把脑中的判断写成文档:上下文工程与模型的服从度
这几年把 AI 导入工作之后,我逐步把原本只存在脑中的判断拆解、externalize(外部化),整理成一份可控的“上下文工程文档”(Context Engineering Document)。

我用三件事评估一个模型
目前,我在评估一个模型适不适合用在“高纪律、高溯源”的工作上时,主要看三件事:
- 能不能遵守既定的规则;
- 信息不足的时候,会不会自己“补位”;
- 输出的内容,能不能被追溯与审核。
一份此刻的实测心得
以下是我近期的实测心得——先声明,这纯粹是我当下、个人的使用经验,模型也一直在更新,未必适用于每个人、每个版本:
- Claude:上下文的服从度最高,比较能贴着既定规则运行,所以我把它当作主力,用来承载判断层。
- GPT:次之。溯源相对可控,但信息不足时偶尔会用训练数据来补位,我主要拿它做备援与特定任务。
- Gemini:对这类长篇、高纪律的工作比较吃力,曾经一口气列出整批虚构的来源,因此暂时退出了这条主线。
拉开差距的,是“服从已外部化的判断”
对我来说,真正拉开模型之间差距的关键,其实不只是模型本身的能力,而是它能不能“服从”那份已经被我外部化的专业判断。
工具会持续更新,但先把脑中的判断写清楚——这件事,和你选择用哪一个工具,其实同等重要。