本站提供正體中文版。切換到正體中文本站提供简体中文版。切换到简体中文This site is available in English.View in Englishこのサイトには日本語版があります。日本語で表示이 사이트는 한국어로도 제공됩니다.한국어로 보기Diese Website ist auch auf Deutsch verfügbar.Auf Deutsch ansehenEste sitio web también está disponible en español.Ver en españolQuesto sito è disponibile anche in italiano.Visualizza in italianoCe site est également disponible en français.Afficher en françaisEste site também está disponível em português.Ver em portuguêsDeze website is ook beschikbaar in het Nederlands.In het Nederlands bekijkenЭтот сайт также доступен на русском языке.Смотреть на русскомयह वेबसाइट हिन्दी में भी उपलब्ध है।हिन्दी में देखेंهذا الموقع متاح أيضًا باللغة العربية.عرض بالعربيةSitus ini juga tersedia dalam bahasa Indonesia.Lihat dalam bahasa IndonesiaBu site Türkçe olarak da mevcut.Türkçe görüntüleTa strona jest dostępna także po polsku.Wyświetl po polskuاین وب‌سایت به فارسی هم در دسترس است.مشاهده به فارسی

Năng lực răng cưa của LLM: vì sao AI lúc thì thần thánh, lúc lại ngớ ngẩn

AI2026.05

Cùng một LLM, một mặt có thể tái cấu trúc mạch lạc cả 100.000 dòng mã, mặt khác lại đưa ra lời khuyên vô lý hết chỗ nói kiểu “đi bộ tới tiệm rửa xe để rửa xe”. Khoảng cách khổng lồ về năng lực ấy chính là cái gọi là “năng lực răng cưa” (jaggedness).

Biểu đồ đường gấp khúc răng cưa minh họa phân bố năng lực của LLM: bên trái, con robot đi trên đường ray học tăng cường nên vận hành trơn tru; bên phải, con robot cầm dao rựa chém loạn xạ giữa rừng rậm

Mấu chốt không nằm ở khó hay dễ, mà ở chỗ “đã từng luyện hay chưa”

Điều thú vị là mấu chốt không nằm ở chỗ “con người thấy việc này khó hay dễ”, mà ở chỗ nhiệm vụ đó có rơi vào phân bố dữ liệu huấn luyện của mô hình hay không.

Andrej Karpathy, cựu thành viên sáng lập OpenAI và cựu giám đốc AI của Tesla, đã chỉ ra hai nguyên nhân chính:

  1. Khả năng kiểm chứng (verifiability): mã có tín hiệu đúng sai rõ ràng — biên dịch được hay không, kiểm thử có qua hay không — nên rất dễ được học tăng cường (RL) lấy ra huấn luyện và củng cố lặp đi lặp lại.
  2. Yếu tố kinh tế: những năng lực có giá trị thương mại sẽ được các phòng thí nghiệm tiên phong ưu tiên đóng gói vào phân bố dữ liệu huấn luyện; còn hiểu biết thường thức của đời sống hằng ngày thì thường bị bỏ qua.

Đi trên đường ray thì trơn tru, vừa chệch ra là bắt đầu chém loạn

Kết quả là: khi mô hình đi trên đường ray mà học tăng cường đã trải sẵn, nó bay vừa nhanh vừa mượt; nhưng một khi chệch khỏi đường ray thì chẳng khác nào có người cầm dao rựa chém loạn xạ giữa rừng rậm — bề ngoài trông như đang nghiêm túc thực hiện, còn việc thật sự làm thì vô lý hết mức.

Vì thế, muốn dùng LLM cho thật tốt và tránh giẫm phải mìn, bạn phải xây cho mình một mô hình hiểu biết “đủ chính xác” về năng lực của nó: biết những nhiệm vụ nào nó đang ở trên đường ray, và những nhiệm vụ nào thật ra nó đã bước vào rừng rậm.