Langsung ke konten utama

SEMMA (Sample, Explore, Modify, Model, Assess)



 

SEMMA adalah singkatan dari Sample, Explore, Modify, Model, dan Assess. Ini adalah sebuah model proses yang dikembangkan oleh SAS Institute, salah satu produsen perangkat lunak statistik dan bisnis intelligence. Model ini membimbing pelaksanaan proyek data mining dengan menekankan pada pengembangan dan penilaian model. Berikut adalah penjelasan singkat tentang masing-masing tahap SEMMA:

  • Sample : Tahap ini bersifat opsional, yaitu mengambil sampel data dari kumpulan data yang besar untuk menampung informasi yang signifikan, namun dapat dimanipulasi dengan cepat.
  • Explore : Tahap ini adalah mengeksplorasi data yang sudah dikumpulkan dengan mencari tren dan anomali yang tak terduga dalam rangka untuk mendapatkan pemahaman dan ide-ide.
  • Modify : Tahap ini adalah memodifikasi data dengan menciptakan, menyeleksi, dan mentransformasi variabel-variabel untuk fokus pada proses pemilihan model.
  • Model : Tahap ini adalah memodelkan data yang sudah dimodifikasi dengan menggunakan perangkat lunak untuk mencari secara otomatis kombinasi data yang dapat diandalkan untuk memprediksi hasil yang diinginkan.
  • Assess : Tahap ini adalah menilai data dengan mengevaluasi kegunaan dan keandalan penemuan dari proses data mining dan mengevaluasi sebaik mana model tersebut bekerja.
     

Komentar

Postingan populer dari blog ini

Data Transform

  Transformasi data merupakan proses mengubah format, skala, atau representasi data dari bentuk awalnya menjadi bentuk yang lebih sesuai atau lebih mudah untuk diproses, dianalisis, atau dimodelkan. Tujuannya adalah untuk meningkatkan kualitas data, mengurangi kekacauan, atau menyesuaikan data agar cocok dengan kebutuhan analisis atau pemodelan yang akan dilakukan. Beberapa teknik transformasi data umum meliputi: Normalisasi: Mengubah nilai-nilai dalam dataset ke skala yang relatif, sering kali antara 0 dan 1, untuk memastikan bahwa semua variabel memiliki pengaruh yang seimbang dalam analisis. Standardisasi: Mengubah nilai-nilai dalam dataset sehingga memiliki mean 0 dan deviasi standar 1, sehingga mendukung perbandingan antar variabel yang memiliki unit yang berbeda. Transformasi Logaritmik: Menggunakan logaritma alami atau logaritma lainnya untuk mengubah distribusi data yang tidak normal atau cenderung mendekati distribusi normal. Transformasi Box-Cox: Menggunakan tr...

Data Visualization

  Data Visualization atau Visualisasi Data adalah representasi grafis dari informasi dan data. Dengan visualisasi data, informasi yang kompleks dapat disajikan dalam format yang lebih mudah dipahami dan diinterpretasikan. Tujuan utama visualisasi data adalah untuk mengomunikasikan informasi secara jelas dan efisien kepada pengguna. Beberapa tipe visualisasi data yang umum digunakan: Grafik Batang (Bar Chart) : Digunakan untuk membandingkan nilai-nilai dari beberapa kategori atau kelompok data. Grafik Garis (Line Chart) : Menampilkan perubahan data dalam rentang waktu atau urutan tertentu. Grafik Pie (Pie Chart) : Menunjukkan proporsi atau persentase dari keseluruhan data dalam bentuk lingkaran. Histogram : Menggambarkan distribusi frekuensi data dalam bentuk batang. Peta (Maps) : Memvisualisasikan data berdasarkan lokasi geografis. Scatter Plot : Menunjukkan hubungan antara dua set data numerik. Treemap : Menampilkan hierarki data dalam bentuk persegi panjang bersarang. Vis...

Pertemuan 10 Data Mining

  Supervised learning mengacu pada sebuah teknologi kecerdasan buatan tergolong ke dalam kategori machine learning, di mana teknologi ini melatih algoritma dari perangkat komputer pada proses input data yang telah diberi label untuk output tertentu. Singkatnya, perancangan jenis learning ini khusus untuk melatih input data. Algoritma komputer dilatih sampai mendapat hasil yakni dapat melakukan deteksi pola serta hubungan mendasar antara input data dan output label. Nantinya, hal itu akan memungkinkan penyajian dengan hasil pelabelan yang akurat. Pembelajaran satu ini dapat membantu perusahaan dalam memecahkan masalah berskala besar. Jenis machine learning ini cocok untuk menyelesaikan masalah klasifikasi maupun regresi, seperti melakukan penentuan terhadap kategori yang ada pada artikel maupun melakukan prediksi terkait dengan volume penjualan pada waktu tertentu di masa mendatang. Tujuan jenis learning satu ini adalah untuk memperdalam pemahaman data dalam konteks pertanyaan. Supe...