本站提供正體中文版。切換到正體中文This site is available in English.View in Englishこのサイトには日本語版があります。日本語で表示이 사이트는 한국어로도 제공됩니다.한국어로 보기Diese Website ist auch auf Deutsch verfügbar.Auf Deutsch ansehenEste sitio web también está disponible en español.Ver en españolQuesto sito è disponibile anche in italiano.Visualizza in italianoCe site est également disponible en français.Afficher en françaisEste site também está disponível em português.Ver em portuguêsDeze website is ook beschikbaar in het Nederlands.In het Nederlands bekijkenЭтот сайт также доступен на русском языке.Смотреть на русскомयह वेबसाइट हिन्दी में भी उपलब्ध है।हिन्दी में देखेंهذا الموقع متاح أيضًا باللغة العربية.عرض بالعربيةSitus ini juga tersedia dalam bahasa Indonesia.Lihat dalam bahasa IndonesiaBu site Türkçe olarak da mevcut.Türkçe görüntüleTa strona jest dostępna także po polsku.Wyświetl po polskuTrang web này cũng có phiên bản tiếng Việt.Xem bằng tiếng Việtاین وب‌سایت به فارسی هم در دسترس است.مشاهده به فارسی

把脑中的判断写成文档:上下文工程与模型的服从度

AI2026.06

这几年把 AI 导入工作之后,我逐步把原本只存在脑中的判断拆解、externalize(外部化),整理成一份可控的“上下文工程文档”(Context Engineering Document)。

模型评比信息图,把 Claude 列为主力、GPT 为备援、Gemini 因曾列出虚构来源而淘汰,并注明此为个人当下实测、非客观定论

我用三件事评估一个模型

目前,我在评估一个模型适不适合用在“高纪律、高溯源”的工作上时,主要看三件事:

  1. 能不能遵守既定的规则;
  2. 信息不足的时候,会不会自己“补位”;
  3. 输出的内容,能不能被追溯与审核。

一份此刻的实测心得

以下是我近期的实测心得——先声明,这纯粹是我当下、个人的使用经验,模型也一直在更新,未必适用于每个人、每个版本:

  • Claude:上下文的服从度最高,比较能贴着既定规则运行,所以我把它当作主力,用来承载判断层。
  • GPT:次之。溯源相对可控,但信息不足时偶尔会用训练数据来补位,我主要拿它做备援与特定任务。
  • Gemini:对这类长篇、高纪律的工作比较吃力,曾经一口气列出整批虚构的来源,因此暂时退出了这条主线。

拉开差距的,是“服从已外部化的判断”

对我来说,真正拉开模型之间差距的关键,其实不只是模型本身的能力,而是它能不能“服从”那份已经被我外部化的专业判断。

工具会持续更新,但先把脑中的判断写清楚——这件事,和你选择用哪一个工具,其实同等重要。