把腦中的判斷寫成文件:上下文工程與模型的服從度
這幾年把 AI 導入工作之後,我逐步把原本只存在腦中的判斷拆解、externalize(外部化),整理成一份可控的「上下文工程文件」(Context Engineering Document)。

我用三件事評估一個模型
目前,我在評估一個模型適不適合用在「高紀律、高溯源」的工作上時,主要看三件事:
- 能不能遵守既定的規則;
- 資訊不足的時候,會不會自己「補位」;
- 輸出的內容,能不能被追溯與稽核。
一份此刻的實測心得
以下是我近期的實測心得——先聲明,這純粹是我當下、個人的使用經驗,模型也一直在更新,未必適用於每個人、每個版本:
- Claude:上下文的服從度最高,比較能貼著既定規則執行,所以我把它當作主力,用來承載判斷層。
- GPT:次之。溯源相對可控,但資訊不足時偶爾會用訓練資料來補位,我主要拿它做備援與特定任務。
- Gemini:對這類長篇、高紀律的工作比較吃力,曾經一口氣列出整批虛構的來源,因此暫時退出了這條主線。
拉開差距的,是「服從已外部化的判斷」
對我來說,真正拉開模型之間差距的關鍵,其實不只是模型本身的能力,而是它能不能「服從」那份已經被我外部化的專業判斷。
工具會持續更新,但先把腦中的判斷寫清楚——這件事,和你選擇用哪一個工具,其實同等重要。