Halaman

Tampilkan postingan dengan label Data Mining. Tampilkan semua postingan
Tampilkan postingan dengan label Data Mining. Tampilkan semua postingan

Jumat, 20 Juli 2012

Data Mining: Studi Kasus(2) Teknik Klasifikasi

Bagaimana cara implementasi data mining untuk teknik klasifikasi pada algoritma C4.5 ??. Seperti penjelasan teori sebelumnya tentang apa itu data mining data yang akan diolah untuk teknik ini merupakan dari data sebelumnya/histori/pengalaman. Hal ini dibuat untuk digunakan pengambilan keputusan untuk kejadian yang akan datang. Data yang diolah saat ini akan dijadikan model patokan guna keputusan selanjutnya. 

Data yang digunakan untuk bisa menjadi sebuah model yang baik idealnya mencukupi sebagai data riset. Semakin banyak data dan semakin sedikit kesalahan(error) maka semakin bagus model yang dijadikan patokan.

Teknik data mining yang akan diproses menggunakan sebuah Tools seperti RapidMiner, Weka dsb. Perhitungan algoritma akan proses/dilakukan secara otomatis oleh Tools tersebut.Oleh karena itu, untuk mengetahui algoritma sesungguhnya dilakuan perhitungan secara manual(lihat contoh disini)


Data pegawai dari suatu perusahaan.
Pegawai
Jabatan
Jenis Kelamin
Umur
Asal
Kategori
Gaji
1
service
Perempuan
45
Kota Besar
Level-3
2
service
Laki-laki
25
Kota Besar
Level-1
3
service
Laki-laki
33
Kota Kecil
level-2
4
Manajemen
Laki-laki
25
Kota Besar
Level-3
5
Manajemen
Perempuan
35
Kota Kecil
Level-4
6
Manajemen
Laki-laki
26
Kota Kecil
Level-3
7
Manajemen
Perempuan
45
Kota Besar
Level-4
8
Sales
Perempuan
40
Kota Kecil
Level-3
9
Sales
Laki-laki
30
Kota Besar
level-2
10
Staf
Perempuan
50
Kota Besar
level-2
11
Staf
Laki-laki
25
Kota Kecil
Level-1

Langkah-langkah untuk membuat decision tree(pohon keputusan) dari data diatas
Menggunakan software : RapidMiner
1.       Buka software rapidminer
2.       File - new
3.       Pilih direktori penyimpanan di : NewLocalrepository, kemudian berikan nama file “datakaryawan” kemudian klik OK
4.       Maka tampil main process
5.       Dibagian tab sebelah kiri ada tab operator, pilih Import - data - Read Excel
Hal ini digunakan untuk mengimport data kita. Ada berbagai macam pilihan disesuaikan dengan data yang kita punya(dalam hal ini menggunakan excel)
Lalu Klik and drag “Read Excel” tersebut kedalam Main Process
6.     Masih dalam keadaan terseleksi(untuk Read Excel) lihat di bagian sebelah kanan ada tab parameters
Klik Import Configuration Wizard
7.       Kemudian tampil jendela import wizard - pilih direktori dimana file datakaryawan disimpan == next
8.       Langkah selanjutnya adalah pemilihan range data mana saja yang akan diimport. Dalam hal ini semuanya maka klik Next - Next
9.       Dilangkah ini, tentukan label dan tipe data untuk setiap atribut
*keterangan
Polynom               = tipe data ini untuk karakter baik angka ataupun huruf (sama seperti varchar/text)
Binominom           = tipe data ini untuk 2 kategori (Y/T, L,P, Besar/Kecil, dll)
Atribut                 = digunakan sebagai variable predictor/prediksi
Label                    = digunakan sebagai variable tujuan

10.   Klik finish dan kembali ke main process
11.   Ambil data yang telah diimport melalui wizard tadi di tab operator, ketik decision tree pada bagian filter
 12.   Kemudian klik and drag “decision tree” ke main process
13.   Kemudian klik and drag “out” (pada Read Excel) KE “tra”(pada decision tree)
14.   Kemudian klik and drag “mod” (pada decision tree) KE “res” disebelah kanan main process
15.   Klik process - run atau klik pada toolbar
16.   Maka akan tampil decision tree seperti dibawah ini


 Untuk lebih jelasnya silakan download langkahnya dalam bentuk PDF disini










» Read more → Data Mining: Studi Kasus(2) Teknik Klasifikasi

Rabu, 30 Mei 2012

Data Mining - Studi Kasus(1) Teknik Klasifikasi

Dari pembahasan sebelumnya, dalam tahap data mining terdapat beberapa teknik yang bisa dilakukan untuk sebuah kasus. Salah satu nya adalah teknik klasifikasi. Tahap pemilihan teknik dalam data mining harus sesuai dengan tujuan dan algoritma untuk pencarian pola

Berikut pembahasan kali ini :
  • Tahap Data Mining : Klasifikasi
  • Metode klasifikasi yang digunakan : Decision Tree
  • Algoritma Decision Tree yang dicoba : C4.5
     
Klasifikasi sendiri merupakan suatu proses menemukan kumpulan pola atau fungsi yang mendeskripsikan serta memisahkan kelas data yang satu dengan yang lainnya untuk menyatakan objek tersebut masuk pada kategori tertentu yang sudah ditentukan.


secara umum, proses klasifikasi terdapat 2 tahap :
- Proses "belajar" (training data set) : berasal dari data pelatihan (yg sudah ada)
- Kasus   baru (new case) :


Contoh kasus yang akan dibahas dalam data mining teknik klasifikasi metode decision tree dengan algoritma C.45






Dari data diatas akan dibahas:
1. Perhitungan secara manual
2. Mencocokkan hasil perhitungan manual dengan penggunaan tools aplikasi dari
    a. WEKA
    b. Rapidminer

Oke.., untuk pembahasannya kita lanjutkan disini

*sumber
-larose
-berbagai sumber






» Read more → Data Mining - Studi Kasus(1) Teknik Klasifikasi

Kamis, 19 April 2012

Apa itu Data Mining..?


Apa itu data mining ?
What the mean of data mining..?? hmmm…dilihat dari pengertiannya “mining” berarti tambang/penggalian. Jadi secara makna data mining merupakan penggalian lebih untuk mendapatkan informasi yang berguna dari data yang sudah ada. Untuk apa ?? tentunya sekumpulan informasi yang kita terima dikumpulkan, dianalisa dan disimpulkan untuk memprediksi suatu permasalahan yang mungkin akan terjadi dimasa datang dan pengambilan keputusan.
Zaman dulu, mencari sebuah data dan informasi tidaklah mudah, berbeda dengan zaman sekarang sangat banyak dan begitu cepat informasi yang beredar. Tinggal search di google semua pilihan informasi tersedia, bahkan saking banyaknya kita harus pandai memilah dan memilih informasi mana yang memang kita butuhkan. Oke, itu sedikit pembuka dari saya sekarang mari kita mengenal lebih dalam apa itu data mining.. ^_^



Definisi Data Mining
Data mining adalah suatu istilah yang digunakan untuk menguraikan penemuan pengetahuan di dalam database. Data mining adalah proses yang menggunakan teknik statistic, matematika, kecerdasan buatan, dan machine elerning untuk mengekstrasi dan mengidentifikasi informasi yang bermanfaat dan pengetahuan yang terkait dari berbagai database besar [Turban, 2005].

Inti dari data mining adalah kegiatan penggalian pengetahuan data. Pengertian dari istilah lain yang hampir mirip dengan data mining adalah Knowledge discovery dan pattern recognition.

*Knowledge discovery : menemukan pengetahuan dari bongkahan data yang masih tersembunyi
*pattern recognition : pengenalan pola. Pengetahuan yang digali masih berbentuk pola-pola yang mungkin masih perlu digali dalam bongkahan data


Pengelompokkan Data Mining
Data mining dibagi menjadi beberapa kelompok berdasarkan tugas yang dapat dilakukan , yaitu
1. Deskripsi
Menggambarkan sekumpulan data secara ringkas. Data yang digambarkan berupa:
- Deskripsi grafis : diagram titik, histogram
- deskripsi lokasi : mean(rata-rata), median(nilai tengah), modus, kuartil, persentil
- Deskripsi keberagaman : range(rentang), varians dan standar deviasi

2. Estimasi
Memperkirakan suatu hal dari sejumlah sample yang kita miliki(yg tidak kita ketahui)
Estimasi hampir sama dengan klasifikasi, kecuali variable target. Estimasi lebih kearah numeric dari pada kearah kategori.

3. Prediksi
Prediksi hampir sama dengan klasifikasi dan estimasi, kecuali bahwa dalam prediksi nilai dari hasil akan ada dimasa datang(memperkirakan hal yang belum terjadi). Kita bisa menunggu hingga hal itu terjadi untuk membuktikan seberapa tepat prediksi kita

4. Klasifikasi
kegiatan menggolongkan, dengan menggunakan data historis(sebagai data yang digunakan untuk latihan dan sebagai pengalaman).Dalam klasifikasi terdapat variabel prediktor dan target variable,

5. Pengklusteran
Pengkulusteran merupakan pengelompokan record, pengamatan atau memperhatikan dan membentuk kelas objek-objek yang memiliki kemiripan. Kluster adalah kumpulan record yang memiliki kemiripan satu dengan yang lainya dan memiliki ketidak miripan dengan record-record dalam cluster.

6. Asosiasi
Tugas asosiasi dalam data mining adalah menemukan atribut yang muncul dalam satu waktu. Dalam dunia bisnis lebih umum disebut analisis keranjang biasa.

Berdasarkan pengelompokkan data mining tersebut, masing masing memiliki kelompok fungsi antara lain:
-- Fungsi Minor (tambahan) : deskripsi, estimasi, prediksi
-- Fungsi Mayor (utama) : klasifikasi, pengelompokkan, estimasi

Knowledge Discovery In Database (Penemuan Pengetahuan dalam Database)
Data mining digambarkan sebagai proses pencarian pengetahuan yang menarik dalam database seperti pola , asosiasi, aturan, perubahan, keganjilan dan struktur penting dari sejumlah besar data yang disimpan pada bank data dan tempat penyimpanan informasi lainnya. Berikut merupakan proses KDD
1. pemilihan data (data selection), pemilihan data relevan yang didapat dari basis data;
2. pembersihkan data (data cleaning), proses menghilangkan noise dan data yang tidak konsisten atau data tidak relevan;
3. pengintegrasian data (data integration), penggabungan data dari berbagai basisdata ke dalam satu basisdata baru;
4. transformasi data, data diubah atau digabung ke dalam format yang sesuai untuk diproses dalam data mining;
5. data mining, suatu proses di mana metoda diterapkan untuk menemukan pengetahuan berharga dan tersembunyi dari data;
6. evaluasi pola (pattern evaluation), untuk mengidentifikasi pola-pola menarik untuk di representasikan kedalam knowledge based;
7. representasi pengetahuan (knowledge presentation), visualisasi dan penyajian pengetahuan mengenai teknik yang digunakan untuk memperoleh pengetahuan yangdiperoleh pengguna

Sumber :
*larose (Discovering Knowledge in Data)
*sani susanto, dedy suryadi (Pengantar data mining-Menggali Pengetahuan dari Bongkahan Data)

» Read more → Apa itu Data Mining..?