Рваный интеллект LLM: почему ИИ то гений, то глупец
Одна и та же LLM может, с одной стороны, методично отрефакторить сто тысяч строк кода, а с другой — дать совет, до нелепости абсурдный, вроде «сходите пешком на автомойку, чтобы помыть машину». Этот огромный разрыв в способностях и называют «рваным интеллектом» (jaggedness).

Дело не в сложности, а в том, «была ли практика»
Интересно, что дело не в том, «считают ли люди задачу сложной или простой», а в том, попадает ли эта задача в распределение обучающих данных модели.
Андрей Карпати (Andrej Karpathy) — один из основателей OpenAI и бывший директор по ИИ в Tesla — указывает на две главные причины:
- Проверяемость (verifiability): у кода есть чёткий сигнал правильности или ошибки — компилируется ли он, проходит ли тесты, — что делает его удобным материалом для обучения с подкреплением (RL), которое снова и снова его тренирует и закрепляет.
- Экономические факторы: способности, обладающие коммерческой ценностью, в первую очередь упаковываются передовыми лабораториями в распределение обучающих данных; а вот здравый смысл повседневной жизни зачастую остаётся без внимания.
На рельсах — гладко, стоит сойти с них — начинается рубка мачете
В итоге получается так: пока модель движется по рельсам, проложенным обучением с подкреплением, она летит быстро и плавно; но стоит ей сойти с рельсов — и это выглядит так, будто кто-то остервенело рубит мачете в джунглях: со стороны кажется, что задача выполняется добросовестно, но на деле происходящее совершенно абсурдно.
Поэтому, чтобы по-настоящему хорошо использовать LLM и избегать «мин», нужно выстроить «достаточно точную» модель понимания её способностей: знать, в каких задачах она остаётся на рельсах, а в каких на самом деле уже забрела в джунгли.