Pembelajaran mesin dari data: makin banyak sampel, makin akurat

InformatikaData, AI, dan pembelajaran mesinUsia 16–17

Sebuah pengklasifikasi sederhana belajar dari sampel berlabel: ia menghitung titik pusat (centroid) setiap kelas, lalu memakai garis sumbu antara kedua titik pusat sebagai batas keputusan. Siswa mengatur jumlah sampel latih, tingkat derau label, dan seberapa timpang pengumpulan datanya; model dilatih ulang, dan akurasinya diukur pada kumpulan tetap berisi 400 sampel uji. Jika data latih sebagian besar berasal dari satu kelompok, akurasi keseluruhan masih tampak tinggi, tetapi akurasi untuk kelompok yang kurang terwakili turun tajam — itulah bias data.