Kosakata NotebookIstilah yang Muncul Saat Model Dilatih dan Diuji
Istilah berikut akan Anda temui di materi PDF, di catatan trainer, dan di pesan yang dicetak scikit-learn. Tiap penjelasan ditulis sesingkat mungkin lalu diberi satu contoh pemakaian, supaya istilahnya menempel pada kejadian nyata.
Machine learning
Cara membuat komputer menemukan pola dari contoh data, lalu memakai pola itu untuk menebak kasus baru tanpa aturan yang ditulis satu per satu. Contoh: menebak pelanggan yang akan berhenti berlangganan dari riwayat transaksinya.
Supervised learning
Pembelajaran dari data yang sudah memuat jawaban benar. Bentuknya dua: klasifikasi untuk menebak kategori, seperti lolos atau tidak lolos, dan regresi untuk menebak angka, seperti jumlah penjualan bulan depan.
Fitur dan target
Fitur adalah kolom masukan yang dibaca model, misalnya usia akun dan frekuensi belanja. Target adalah kolom yang ingin ditebak. Salah menaruh kolom ke dalam fitur bisa membuka pintu kebocoran data.
scikit-learn
Pustaka Python sumber terbuka untuk machine learning klasik. Semua modelnya memakai pola yang sama, fit untuk melatih dan predict untuk menebak, sehingga mengganti algoritma cukup dengan mengubah satu baris.
DataFrame
Tabel di pandas yang tersusun dari baris dan kolom, mirip lembar kerja spreadsheet. Anda memakainya untuk memfilter, menggabungkan, dan meringkas data sebelum diserahkan ke model.
EDA
Exploratory data analysis, pemeriksaan awal data lewat ringkasan statistik dan grafik. Dari sini Anda tahu kolom yang banyak kosong, nilai yang janggal, dan kelas yang jumlahnya timpang.
Train-test split
Pemisahan sebagian data sebagai ujian akhir yang tidak disentuh selama pelatihan dan tuning. Test set yang terlalu sering diintip lama-lama ikut membentuk model, dan skornya kehilangan makna.
Cross-validation
Validasi silang. Data latih dibagi menjadi beberapa lipatan, model dilatih berulang dengan lipatan uji yang bergantian, lalu skornya dirata-rata. Sebaran skor antarlipatan menunjukkan seberapa stabil model Anda.
Hiperparameter
Setelan model yang ditentukan sebelum pelatihan, misalnya kedalaman maksimum pohon keputusan. Nilai terbaiknya dicari lewat tuning di dalam validasi silang, dengan test set tetap tersimpan.
Bias-variance trade-off
Tarik-menarik antara model yang terlalu sederhana sehingga meleset terus (underfitting) dan model yang terlalu rumit sehingga menghafal data latih (overfitting). Learning curve membantu Anda melihat model berada di sisi mana.
Data leakage
Kebocoran data, yaitu informasi yang tidak akan tersedia saat model dipakai ikut masuk ke pelatihan. Skornya tampak tinggi, lalu runtuh di data baru. Contoh: menskalakan seluruh data sebelum dipisah.
Accuracy
Proporsi tebakan benar dari seluruh tebakan. Mudah dipahami, tetapi menyesatkan saat kelas timpang: bila hampir semua transaksi normal, model yang selalu menebak normal pun terlihat sangat akurat.
Precision dan recall
Precision menjawab: dari semua tebakan positif, berapa yang benar. Recall menjawab: dari semua kasus positif, berapa yang tertangkap. Menaikkan yang satu biasanya menurunkan yang lain, jadi pilihannya mengikuti harga kesalahan.
ROC-AUC
Ukuran seberapa baik model menaruh kasus positif di atas kasus negatif pada semua ambang keputusan. Nilai 0,5 setara tebakan acak dan 1 berarti urutan sempurna. Pada kelas yang sangat timpang, kurva precision-recall sering lebih jujur.
MSE
Mean squared error, rata-rata kuadrat selisih antara prediksi dan nilai sebenarnya pada regresi. Kesalahan besar dihukum lebih berat. Akarnya, RMSE, kembali ke satuan target sehingga lebih mudah dijelaskan.