Training Model

Training hanya memakai baris yang sudah dipreprocessing dan sudah berlabel. Jika sebuah batch belum muncul di sini atau jumlah "siap dilatih"-nya masih kurang, jalankan Preprocessing lalu Pelabelan Data terlebih dahulu.

Pembagian data latih/uji sekarang otomatis stratified (proporsi tiap kelas sentimen dijaga sama di data latih & data uji), dan tersedia opsi SMOTE untuk menyeimbangkan kelas minoritas pada data latih sebelum training.
Catatan (berdasarkan riwayat training Anda sendiri): ternyata yang paling menentukan akurasi bukan max_depth, melainkan opsi "cari split pakai seluruh data latih" di bawah. Riwayat training menunjukkan pola yang jelas:
  • max_depth=100, minLeaf=5, tanpa full-split โ†’ akurasi 59.95%
  • max_depth=200, minLeaf=1, tanpa full-split โ†’ akurasi hanya 54.48%โ€“56.62% (lebih rendah walau depth-nya lebih tinggi!)
  • max_depth=200, minLeaf=1, dengan full-split โ†’ akurasi melompat ke 70.62%โ€“71.14%

Jadi menaikkan max_depth saja (default 50) tidak banyak membantu selama pencarian split masih dibatasi subsampling. Untuk hasil terbaik, aktifkan "cari split pakai seluruh data latih" dan set max_depth ke sekitar 100-200 โ€” persis kombinasi yang menghasilkan akurasi >70% di riwayat training Anda. Konsekuensinya: training jadi jauh lebih lambat (percobaan dengan 100 tree butuh ±29 menit / 1756 detik, dibanding ±90 detik tanpa full-split), jadi mulai dulu dari n_trees kecil (10-30) untuk uji cepat sebelum menaikkan ke 100.

โš ๏ธ Soal memori: kalau max_depth dinaikkan tinggi (150-200 ke atas) SEKALIGUS min_samples_leaf dibiarkan 1, pohon bisa terus membelah sampai leaf isinya 1 baris data โ€” jumlah node per tree jadi sangat besar (dikali n_trees), dan bisa memicu "Allowed memory size exhausted". Kalau mau depth besar, naikkan juga min_samples_leaf ke 5-10: selain jauh lebih hemat memori, ini regularisasi yang mencegah leaf menghafal baris tunggal/noise (overfitting).

๐ŸŒฒ Training Random Forest

๐Ÿ“ Training K-Nearest Neighbor

Riwayat Training

WaktuBatchAlgoritmaData Train/Test AkurasiPrecisionRecallF1-ScoreWaktu LatihPengaturan
15/08/2026 21:39 Data Mentah MBG ๐Ÿ“ KNN 7968 / 1171 56.79% 66.55% 56.79% 58.46% 84.85s Stratified, SMOTE: โœ…, fitur: 3000 , K: 15 , metrik: cosine
15/08/2026 21:34 Data Mentah MBG ๐ŸŒฒ Random Forest 7968 / 1171 71.14% 72% 71.14% 71.49% 1755.97s Stratified, SMOTE: โœ…, fitur: 3000 , depth: 200 , minLeaf: 1 , full-split
15/08/2026 21:02 Data Mentah MBG ๐ŸŒฒ Random Forest 7968 / 1171 70.62% 72.21% 70.62% 71.14% 68.15s Stratified, SMOTE: โœ…, fitur: 3000 , depth: 200 , minLeaf: 1 , full-split
15/08/2026 20:55 Data Mentah MBG ๐ŸŒฒ Random Forest 7968 / 1171 56.62% 71.59% 56.62% 57.7% 608.43s Stratified, SMOTE: โœ…, fitur: 3000 , depth: 200 , minLeaf: 1
15/08/2026 20:42 Data Mentah MBG ๐ŸŒฒ Random Forest 7968 / 1171 54.48% 71.17% 54.48% 55.77% 76.61s Stratified, SMOTE: โœ…, fitur: 3000 , depth: 200 , minLeaf: 1
15/08/2026 20:20 Data Mentah MBG ๐Ÿ“ KNN 7968 / 1171 55.59% 64.16% 55.59% 57.36% 53.93s Stratified, SMOTE: โœ…, fitur: 3000 , K: 7 , metrik: cosine
15/08/2026 20:17 Data Mentah MBG ๐ŸŒฒ Random Forest 7968 / 1171 59.95% 72.94% 59.95% 61.46% 89.16s Stratified, SMOTE: โœ…, fitur: 3000 , depth: 100 , minLeaf: 5