本站提供正體中文版。切換到正體中文本站提供简体中文版。切换到简体中文This site is available in English.View in Englishこのサイトには日本語版があります。日本語で表示이 사이트는 한국어로도 제공됩니다.한국어로 보기Diese Website ist auch auf Deutsch verfügbar.Auf Deutsch ansehenEste sitio web también está disponible en español.Ver en españolQuesto sito è disponibile anche in italiano.Visualizza in italianoCe site est également disponible en français.Afficher en françaisDeze website is ook beschikbaar in het Nederlands.In het Nederlands bekijkenЭтот сайт также доступен на русском языке.Смотреть на русскомयह वेबसाइट हिन्दी में भी उपलब्ध है।हिन्दी में देखेंهذا الموقع متاح أيضًا باللغة العربية.عرض بالعربيةSitus ini juga tersedia dalam bahasa Indonesia.Lihat dalam bahasa IndonesiaBu site Türkçe olarak da mevcut.Türkçe görüntüleTa strona jest dostępna także po polsku.Wyświetl po polskuTrang web này cũng có phiên bản tiếng Việt.Xem bằng tiếng Việtاین وب‌سایت به فارسی هم در دسترس است.مشاهده به فارسی

A capacidade dentada dos LLM: por que a IA ora é um gênio, ora é um tolo

IA2026.05

Um mesmo LLM pode, por um lado, reestruturar de forma ordenada cem mil linhas de código e, por outro, dar um conselho tão absurdo ao extremo como “vá a pé até o lava-rápido lavar o carro”. Esse enorme desnível de capacidade é o que se chama de “capacidade dentada” (jaggedness).

Um gráfico de linha dentada que ilustra a distribuição das capacidades de um LLM: à esquerda, um robô desliza suavemente sobre o trilho da aprendizagem por reforço; à direita, um robô desfere golpes a esmo com um facão numa selva

A chave não está na dificuldade, mas em “se já foi treinado”

O interessante é que a chave não reside em “se os humanos acham a coisa difícil ou fácil”, mas em se essa tarefa cai ou não dentro da distribuição dos dados de treinamento do modelo.

Andrej Karpathy — membro fundador da OpenAI e ex-diretor de IA da Tesla — aponta duas causas principais:

  1. Verificabilidade (verifiability): o código tem um sinal claro de certo ou errado — ele compila? os testes passam? —, o que o torna facílimo de ser retomado pela aprendizagem por reforço (RL) para treiná-lo e reforçá-lo repetidas vezes.
  2. Fatores econômicos: as capacidades dotadas de valor comercial são empacotadas com prioridade pelos laboratórios de ponta na distribuição dos dados de treinamento; quanto ao bom senso da vida cotidiana, costuma ser deixado de lado.

No trilho tudo corre liso; assim que se desvia, começa a golpear a esmo

O resultado é este: quando o modelo avança sobre o trilho que a aprendizagem por reforço assentou, ele voa rápido e liso; mas assim que se desvia do trilho, é como alguém que desfere golpes a esmo com um facão numa selva — na superfície parece que está executando a tarefa com diligência, mas o que faz na verdade é absurdo além de qualquer medida.

Portanto, para usar de fato bem um LLM e evitar pisar em minas, é preciso construir um modelo de compreensão “suficientemente preciso” de suas capacidades: saber em quais tarefas ele se mantém sobre o trilho e em quais, na verdade, já adentrou a selva.