# 第二十九章：值得學的那一句 — 教材不能將就

**2026 年 8 月 30 日 – 9 月 3 日**

> 五天。我們想做教材，於是請一位更強的老師，把教練說過的每一句改寫成更好的版本。前前後後查了七百五十句，符合「這句本來就值得學」的，落在一到九句之間——距離原訂的一百句，差了一個量級。我們沒有降低門檻湊數。這一章寫的是一條幾乎沒有產出的路線，以及它為什麼值得寫。

---

## 核心啟發

教材的品質，不取決於你收集了多少句子，取決於有沒有人願意為「這句可以學」負責。如果你把門檻降到剛好湊滿，你教會它的就是你的將就——而你會用往後的每一次表現，替那句將就付帳。

---

## 觀｜思維

Reynolds 在談「永遠覺得自己不夠好」的四種典型時，第一種寫得很直接：

> 「The Expert expects to know everything quickly. There is no place for mistakes and being wrong even when new to a role or task.」
>（「專家」期待自己很快就知道一切。即使才剛接觸一個角色或任務，也不留任何犯錯與看錯的空間。）

書上把這四種樣態放在「覺得自己永遠不夠好」的脈絡裡談，而它們的共同點是：表面上看起來是強悍，底下其實是不敢出錯。

這一週我們一直在扮演那個「專家」。我們以為自己知道什麼樣的教練接話是好的，於是拿自己的判斷當標準，開始生產教材。結果每一次校準都失敗。真正讓事情往前走的那一步，不是換一個更強的模型，而是承認——**「好」的定義不在我們手上。**

---

## 為｜實務與實現

**起點：一個很合理的主意。** 想把自家的模型訓練得更好，就需要教材；教材從哪裡來？很直覺的答案是：從真實會談裡，把教練說得不夠好的那些接話，交給一位**更強的老師**（一個更大型的模型）改寫成更好的版本。這個主意本身沒有問題。問題出現在第一份改稿交回來的當天。

**第一批：流程全綠，結果全錯。** 我們先用三場真實會談的稿子小批量試跑。整條流程一路順暢，沒有任何一處告警，每一步都照著設計完成。人工打開一看：判定「值得學」的四筆樣本裡，**四筆都是誤收**。

這件事後來被寫進紀錄，成為一條通則：**流程正常，只證明每一步都照著做；它不證明你做的方向是對的。** 一個不知道「什麼叫好」的流程，會非常有效率地把不對的東西一路護送到終點。

**第二批到第五批：連「要人審幾筆」都定義不出來。** 接著是一連串失敗，而且每一種死法都不一樣。換一種遮蔽方式重跑的校準，判定不能訓練；二十四場真人稿產出四十筆，其中三十七筆等人審，而人審的判準彼此對不上；改用混合來源的那一批，診斷的規格直接崩掉，剩下的三筆數量也不足以判讀；還有一批更乾脆：連「這一批應該由人審幾筆」這件事本身都無法事先寫清楚，於是整批作廢。中間還有一次正式的執行，因為母體沒有先凍結而中止，而且照著紀律**不重試**。

更前面還有一個很尷尬的發現。我們原本想修的一個毛病——客戶要求換一種問法、教練卻不換——拿去真實語料裡找，**符合條件的樣本掛零**。也就是說，這條路線想修的病灶，有相當一部分只活在我們自己的想像裡。

**轉折點：把判斷權交回給人。** 讓事情往前走的不是技術，是一個決定：不再由模型決定什麼是好接話，改由**那位真正的教練本人**（會談的擁有者）來當標準。做法樸素得幾乎不像一個方法——從一百筆單一接話裡，先挑出二十二筆由他親自判過，這二十二筆就成了語氣與判斷的標尺；剩下七十八筆，在**看不到同一場會談後面發生什麼**的前提下重新預審，避免偷看答案。

其中有一條很人性的規則被寫進紀錄：他採用模型建議的句子，和他自己重寫的句子，**效力完全相同**，不會因為「先看過建議」而被折價。這條規則不只是為了公平。它承認了一件更根本的事：**定義「好」的人是他，不是我們，也不是那個更強的老師。**

**然後是這一章真正的硬骨頭。** 有了標準，我們把範圍放大：從四百八十九場歷史會談裡凍結七百五十句教練接話，分三批，全部查完。每一句都要經過單句審查、獨立批評、完整會談的診斷，再加上會談層級與多樣性的分配。全部跑完之後，符合「原句本來就值得學」的句子，落在**一到九句**之間。

原訂目標是一百句。面對這個數字，有一條很容易走的路：放寬標準、再開一批、把門檻調到剛好湊滿一百。我們沒有走。紀錄上寫得很清楚：母體已經耗盡，誠實收案；不增開、不降低門檻湊數。所有通過的句子先關進隔離區：不進訓練、不當作反例、也不上線。

**同一段時間的其餘兩件事。** 這五天另外把量測的工具修了三處，都不是新實驗，只是讓既有的觀察更可靠；也把幾批既有的教材候選收攏、重新篩過一次。

### 會談實例：把模糊的地方挑出來

> 客戶：「我想讓我的團隊更願意發言。」

> **停在夠用的答案**：「所以你希望他們開會的時候多講一點。」

> **問到值得學的那一句**：「『更願意發言』——你注意到的是他們不開口，還是他們開了口、但沒有人接？」

第一種回應把客戶的話換成一句更扁的同義句，然後往下走；客戶得到的是同意，不是推進。第二種回應把模糊的地方挑出來，問一個他真的需要回答的問題——你注意到的是哪一種沉默？這一句問完，客戶對自己的處境會比剛剛清楚。

這一週我們把第二種態度用在挑教材上：不肯接受一句「差不多可以學」的句子。也誠實承認另一面——**我們一開始根本是那個「專家」**，以為自己很快就能知道什麼是好答案，於是把「來源很多」誤當成「材料很好」。

---

## 得｜成果與心得

具體成果：教材的判準改由真人錨定（二十二筆標尺，加上七十八筆在遮蔽條件下的重審）；一條人性規則入帳（採納建議與自行重寫等價）；七百五十句分三批全數查完，符合條件的落在一到九句；母體耗盡後誠實收案、全數隔離、不降門檻；一條病灶在真實語料裡不存在，因此不修；一批因為連「該由人審幾筆」都定義不出來而作廢；量測工具三處修正。

**開發心得**：這一週幾乎沒有產出。教材沒有生出來，模型沒有變強，北極星沒有動。但我們把一件更根本的事弄清楚了：**要教一個系統「什麼是好」，第一步不是收集好答案，是先找到一個願意說「這句可以學」並且為此負責的人。** 順序顛倒，我們收集到的不過是一堆自己覺得不錯的句子，而用那種教材訓練出來的東西，會在真實會談裡替我們的將就付帳。

也誠實地說：原訂一百句，實際只有一到九句。這不是收穫變少，這是我們的標準第一次比我們的期待誠實。而在這個專案裡，一個誠實的「只有九句」，比一百句湊出來的教材有用得多。

給教練的反問：你有沒有一個正在教別人的東西，其實連你自己都沒有為它立過標準？如果把你手上最好的那幾句挑出來，你敢說「這就是我希望他學的」嗎——還是你只是因為數量夠了，就收下了？

---

*下一章預告：教材這條路暫時封存。同一時間，另一條路徑上線了——而上線的第一場會談，就退化了。*
