本站提供正體中文版。切換到正體中文本站提供简体中文版。切换到简体中文This site is available in English.View in Englishこのサイトには日本語版があります。日本語で表示이 사이트는 한국어로도 제공됩니다.한국어로 보기Diese Website ist auch auf Deutsch verfügbar.Auf Deutsch ansehenEste sitio web también está disponible en español.Ver en españolQuesto sito è disponibile anche in italiano.Visualizza in italianoCe site est également disponible en français.Afficher en françaisEste site também está disponível em português.Ver em portuguêsDeze website is ook beschikbaar in het Nederlands.In het Nederlands bekijkenЭтот сайт также доступен на русском языке.Смотреть на русскомयह वेबसाइट हिन्दी में भी उपलब्ध है।हिन्दी में देखेंهذا الموقع متاح أيضًا باللغة العربية.عرض بالعربيةBu site Türkçe olarak da mevcut.Türkçe görüntüleTa strona jest dostępna także po polsku.Wyświetl po polskuTrang web này cũng có phiên bản tiếng Việt.Xem bằng tiếng Việtاین وب‌سایت به فارسی هم در دسترس است.مشاهده به فارسی

Kemampuan bergerigi pada LLM: mengapa AI sesaat jenius lalu sesaat kemudian bodoh

AI2026.05

Satu LLM yang sama bisa di satu sisi merestrukturisasi 100.000 baris kode dengan runtut, dan di sisi lain memberi saran yang absurdnya keterlaluan seperti “berjalan kaki ke tempat cuci mobil untuk mencuci mobil”. Jurang kemampuan yang begitu besar inilah yang disebut “kemampuan bergerigi” (jaggedness).

Grafik garis bergerigi yang menjelaskan sebaran kemampuan LLM: di sisi kiri robot berjalan mulus di atas rel pembelajaran penguatan, di sisi kanan robot menebas sembarangan dengan golok di tengah rimba

Kuncinya bukan sulit atau mudahnya, melainkan “pernah dilatih atau tidak”

Menariknya, kuncinya bukan terletak pada “apakah manusia merasa hal itu sulit atau mudah”, melainkan pada apakah tugas tersebut berada di dalam distribusi data pelatihan model.

Andrej Karpathy, mantan anggota pendiri OpenAI sekaligus mantan direktur AI di Tesla, menunjukkan dua sebab utama:

  1. Keterverifikasian (verifiability): kode memiliki sinyal benar-salah yang jelas — bisa dikompilasi atau tidak, lulus pengujian atau tidak — sehingga sangat mudah dipakai oleh pembelajaran penguatan (RL) untuk dilatih dan diperkuat berulang kali.
  2. Faktor ekonomi: kemampuan yang bernilai komersial akan lebih diprioritaskan oleh laboratorium terdepan untuk dikemas ke dalam distribusi data pelatihan; sedangkan akal sehat dalam kehidupan sehari-hari justru kerap terabaikan.

Mulus selama di atas rel, begitu menyimpang mulai menebas sembarangan

Hasilnya: ketika model berjalan di atas rel yang telah dibentangkan oleh pembelajaran penguatan, ia melaju cepat dan mulus; tetapi begitu menyimpang dari rel itu, ia seperti orang yang menebas sembarangan dengan golok di tengah rimba — sepintas tampak sedang mengerjakannya dengan sungguh-sungguh, padahal yang dilakukannya luar biasa absurd.

Karena itu, untuk benar-benar memanfaatkan LLM dengan baik dan menghindari ranjau, Anda perlu membangun model pemahaman yang “cukup akurat” tentang kemampuannya: mengetahui tugas-tugas mana yang membuatnya tetap di atas rel, dan tugas-tugas mana yang sebenarnya sudah membawanya masuk ke rimba.