Training Model TF-IDF + Naive Bayes

Bangun vocabulary, hitung IDF, prior, dan likelihood dengan Laplace smoothing

Alur Training

  1. Baca seluruh training_data dan tokenisasi setiap komentar.
  2. Hitung DF dan IDF untuk membangun vocabulary.
  3. Jumlahkan frekuensi token per kelas sentimen.
  4. Hitung prior = n_class / n_total_docs.
  5. Hitung P(w|c) = (count(w,c) + 1) / (count(token,c) + |V|) (Laplace).
  6. Simpan seluruh nilai ke tabel vocab, class_stats, dan term_class_stats.

Data Training Saat Ini

Total
500
Positif
166
Netral
167
Negatif
167

Status Model

Ukuran Vocabulary
212
Prior · Positif
0.3320 docs:166 / token:1927
Prior · Netral
0.3340 docs:167 / token:1842
Prior · Negatif
0.3340 docs:167 / token:1656

Contoh Vocabulary (20 Teratas berdasarkan IDF)

TermDFIDF
antara 5 5.4248
aturan 5 5.4248
bantuan 5 5.4248
berdasarkan 5 5.4248
berharap 5 5.4248
berubah 5 5.4248
diawasi 5 5.4248
dibuat 5 5.4248
dipertahankan 5 5.4248
disampaikan 5 5.4248
disediakan 5 5.4248
disiapkan 5 5.4248
ditetapkan 5 5.4248
evaluasi 5 5.4248
hangat 5 5.4248
harapan 5 5.4248
informasi 5 5.4248
jika 5 5.4248
kebijakan 5 5.4248
kekurangan 5 5.4248