第 29 章意向圖:值得學的那一句
Chapter 29 · audit

值得學的那一句 — 教材不能將就

2026 年 8 月 30 日 – 9 月 3 日

教材的品質取決於有沒有人願意為「這句可以學」負責,不在你收集了多少句。

2026 年 8 月 30 日 – 9 月 3 日

五天。我們想做教材,於是請一位更強的老師,把教練說過的每一句改寫成更好的版本。前前後後查了七百五十句,符合「這句本來就值得學」的,落在一到九句之間——距離原訂的一百句,差了一個量級。我們沒有降低門檻湊數。這一章寫的是一條幾乎沒有產出的路線,以及它為什麼值得寫。


核心啟發

教材的品質,不取決於你收集了多少句子,取決於有沒有人願意為「這句可以學」負責。如果你把門檻降到剛好湊滿,你教會它的就是你的將就——而你會用往後的每一次表現,替那句將就付帳。


觀|思維

Reynolds 在談「永遠覺得自己不夠好」的四種典型時,第一種寫得很直接:

「The Expert expects to know everything quickly. There is no place for mistakes and being wrong even when new to a role or task.」

(「專家」期待自己很快就知道一切。即使才剛接觸一個角色或任務,也不留任何犯錯與看錯的空間。)

書上把這四種樣態放在「覺得自己永遠不夠好」的脈絡裡談,而它們的共同點是:表面上看起來是強悍,底下其實是不敢出錯。

這一週我們一直在扮演那個「專家」。我們以為自己知道什麼樣的教練接話是好的,於是拿自己的判斷當標準,開始生產教材。結果每一次校準都失敗。真正讓事情往前走的那一步,不是換一個更強的模型,而是承認——「好」的定義不在我們手上。


為|實務與實現

起點:一個很合理的主意。 想把自家的模型訓練得更好,就需要教材;教材從哪裡來?很直覺的答案是:從真實會談裡,把教練說得不夠好的那些接話,交給一位更強的老師(一個更大型的模型)改寫成更好的版本。這個主意本身沒有問題。問題出現在第一份改稿交回來的當天。

第一批:流程全綠,結果全錯。 我們先用三場真實會談的稿子小批量試跑。整條流程一路順暢,沒有任何一處告警,每一步都照著設計完成。人工打開一看:判定「值得學」的四筆樣本裡,四筆都是誤收。

這件事後來被寫進紀錄,成為一條通則:流程正常,只證明每一步都照著做;它不證明你做的方向是對的。 一個不知道「什麼叫好」的流程,會非常有效率地把不對的東西一路護送到終點。

第二批到第五批:連「要人審幾筆」都定義不出來。 接著是一連串失敗,而且每一種死法都不一樣。換一種遮蔽方式重跑的校準,判定不能訓練;二十四場真人稿產出四十筆,其中三十七筆等人審,而人審的判準彼此對不上;改用混合來源的那一批,診斷的規格直接崩掉,剩下的三筆數量也不足以判讀;還有一批更乾脆:連「這一批應該由人審幾筆」這件事本身都無法事先寫清楚,於是整批作廢。中間還有一次正式的執行,因為母體沒有先凍結而中止,而且照著紀律不重試。

更前面還有一個很尷尬的發現。我們原本想修的一個毛病——客戶要求換一種問法、教練卻不換——拿去真實語料裡找,符合條件的樣本掛零。也就是說,這條路線想修的病灶,有相當一部分只活在我們自己的想像裡。

轉折點:把判斷權交回給人。 讓事情往前走的不是技術,是一個決定:不再由模型決定什麼是好接話,改由那位真正的教練本人(會談的擁有者)來當標準。做法樸素得幾乎不像一個方法——從一百筆單一接話裡,先挑出二十二筆由他親自判過,這二十二筆就成了語氣與判斷的標尺;剩下七十八筆,在看不到同一場會談後面發生什麼的前提下重新預審,避免偷看答案。

其中有一條很人性的規則被寫進紀錄:他採用模型建議的句子,和他自己重寫的句子,效力完全相同,不會因為「先看過建議」而被折價。這條規則不只是為了公平。它承認了一件更根本的事:定義「好」的人是他,不是我們,也不是那個更強的老師。

然後是這一章真正的硬骨頭。 有了標準,我們把範圍放大:從四百八十九場歷史會談裡凍結七百五十句教練接話,分三批,全部查完。每一句都要經過單句審查、獨立批評、完整會談的診斷,再加上會談層級與多樣性的分配。全部跑完之後,符合「原句本來就值得學」的句子,落在一到九句之間。

原訂目標是一百句。面對這個數字,有一條很容易走的路:放寬標準、再開一批、把門檻調到剛好湊滿一百。我們沒有走。紀錄上寫得很清楚:母體已經耗盡,誠實收案;不增開、不降低門檻湊數。所有通過的句子先關進隔離區:不進訓練、不當作反例、也不上線。

同一段時間的其餘兩件事。 這五天另外把量測的工具修了三處,都不是新實驗,只是讓既有的觀察更可靠;也把幾批既有的教材候選收攏、重新篩過一次。

會談實例:把模糊的地方挑出來

客戶:「我想讓我的團隊更願意發言。」

停在夠用的答案:「所以你希望他們開會的時候多講一點。」

問到值得學的那一句:「『更願意發言』——你注意到的是他們不開口,還是他們開了口、但沒有人接?」

第一種回應把客戶的話換成一句更扁的同義句,然後往下走;客戶得到的是同意,不是推進。第二種回應把模糊的地方挑出來,問一個他真的需要回答的問題——你注意到的是哪一種沉默?這一句問完,客戶對自己的處境會比剛剛清楚。

這一週我們把第二種態度用在挑教材上:不肯接受一句「差不多可以學」的句子。也誠實承認另一面——我們一開始根本是那個「專家」,以為自己很快就能知道什麼是好答案,於是把「來源很多」誤當成「材料很好」。


得|成果與心得

具體成果:教材的判準改由真人錨定(二十二筆標尺,加上七十八筆在遮蔽條件下的重審);一條人性規則入帳(採納建議與自行重寫等價);七百五十句分三批全數查完,符合條件的落在一到九句;母體耗盡後誠實收案、全數隔離、不降門檻;一條病灶在真實語料裡不存在,因此不修;一批因為連「該由人審幾筆」都定義不出來而作廢;量測工具三處修正。

開發心得:這一週幾乎沒有產出。教材沒有生出來,模型沒有變強,北極星沒有動。但我們把一件更根本的事弄清楚了:要教一個系統「什麼是好」,第一步不是收集好答案,是先找到一個願意說「這句可以學」並且為此負責的人。 順序顛倒,我們收集到的不過是一堆自己覺得不錯的句子,而用那種教材訓練出來的東西,會在真實會談裡替我們的將就付帳。

也誠實地說:原訂一百句,實際只有一到九句。這不是收穫變少,這是我們的標準第一次比我們的期待誠實。而在這個專案裡,一個誠實的「只有九句」,比一百句湊出來的教材有用得多。

給教練的反問:你有沒有一個正在教別人的東西,其實連你自己都沒有為它立過標準?如果把你手上最好的那幾句挑出來,你敢說「這就是我希望他學的」嗎——還是你只是因為數量夠了,就收下了?


下一章預告:教材這條路暫時封存。同一時間,另一條路徑上線了——而上線的第一場會談,就退化了。

讀 Reynolds

讀 Reynolds|把判準交還給本人

五天。我們想做教材,於是請一位更強的老師,把教練說過的接話改寫成更好的版本。第一批小批量試跑,流程一路順暢、零告警——人工一看,判定「值得學」的四筆全是誤收。接下來連續幾批各有各的死法,其中一批甚至連「該由人審幾筆」都定義不出來。轉機不是換一個更強的模型,而是把「什麼叫好」交回給那位真正的教練本人:先由他親自判過的二十二筆當標尺,其餘七十八筆在看不到後續對話的條件下重審。

Marcia Reynolds 談教練的角色時,把界線畫得很清楚:

「Coach them to paint the observable picture of what they yearn for that you can both agree on.」

(引導他們描繪出那幅他們所渴望、而你們兩人都能認可的可觀察畫面。)

(章節標註:BC Ch. 9)

那句話裡的關鍵詞是「兩人都能認可」。誰有資格認可?在教練室裡是客戶;在我們的教材裡,是那位真正坐在會談裡的教練本人——不是我們,也不是那個更強的老師。所以後來從四百八十九場歷史會談、七百五十句接話裡全部查完,符合「原句本來就值得學」的只有一到九句。原訂一百句,我們沒有降低門檻湊數。

給臺灣的教練:你手上那個「好」的標準是誰訂的?如果它其實是你自己的偏好,那你教的東西再好,也只是在複製你。

讀完了?如果你也想試試不給建議的對話——

加入 LINE 開始對話