第 21 章意向圖:先審鏡子
Chapter 21 · measure

先審鏡子 — 判官自己也要被判

2026 年 7 月 21 日 – 8 月 4 日

鏡子不先受檢,所有進步與退步都只是鏡子的心情。

2026 年 7 月 21 日 – 8 月 4 日

兩週。我們用來檢驗品質的量測工具,自己兩度被判「量測無效」;三十場模擬會談白跑,只因一道品質門檻在開跑之前就不可能被通過;然後是一場對督導的逐條審判——十三條扣分條文,一條從未影響過任何一個分數,一條名義上指派了、實測從未執行。最後,我們改寫了督導口中最常見的那句假話。這一章只回答一個問題:你用來看見品質的那面鏡子,自己準嗎?


核心啟發

鏡子不先受檢,所有「進步」與「退步」都只是鏡子的心情。教練也一樣:你給回饋的能力,上限就是你聽的準確度——說得出「我是聽到哪一句才這樣說」的回饋,才有資格被稱為觀察;說不出的,是投射。


觀|思維

Reynolds 在談反映式探詢時,把教練的角色講得很物理:

「When people hear their own words spoken, their ideas and beliefs are laid out in front of them to examine.」

(當人們聽見自己說過的話被說出來,他們的想法與信念就攤在眼前,可以被檢視。)

反映的全部力量,建立在一個前提上:你放回去的,必須真的是他說過的。多加一個字的詮釋,鏡子就開始扭曲——客戶檢視的不再是自己的想法,而是你的。

我們的系統裡也有一面這樣的鏡子:每場會談結束後,有一位「督導」(評分判官——不是人,是一個獨立的評分模型)替會談打分數、寫評語。整個品質迴圈都靠它的眼睛。而這兩週我們發現:它最常寫的一句評語——「會談停滯」——在對照人類判讀時,有將近八成是冤枉的。鏡子在說謊,而我們照著這面鏡子調整了好幾個月。


為|實務與實現

連驗鏡子的工具,也要先過自己的檢驗。 這一章開場的兩個「量測無效」,值得先交代。我們曾試著打造一個「讀判詞的儀器」——讓另一個模型自動判讀督導評語的對錯,作為第二層把關。它兩度沒能通過自己事前訂好的關卡:第一次錯放了不該放的判詞,第二次在一組埋好的考題上集體答錯。兩次,我們都照著事前的條款直接關案——不調門檻、不改標準答案、不給第三次機會。聽起來浪費,其實是這一章全部工作的地基:一個沒通過檢驗的檢驗工具,比沒有工具更危險,因為它會給你「已經檢查過了」的錯覺。

先確定門開得了,再開跑。 這一章的第一個教訓很貴:我們設了一道品質門檻,用「洞察品質」這個維度當主判,要求超過 0.80 才算通過——然後跑了三十場模擬會談、花掉三個半小時,才發現這個維度在六百多筆歷史紀錄裡從來沒有超過 0.80。門在開跑之前就是死的,跑它只是花錢演戲。於是我們做了一個「開跑前體檢」(前置檢查,pre-flight):任何實驗開跑前,先機械地確認它要跨的門檻在歷史上是可能被跨過的。答案早就在資料裡,只是從來沒有人在花錢之前先問。

尺要先量自己。 接著我們換上一把刻度更細的尺,但這次不急著用——先讓它把同一批會談量兩次(重測信度,test-retest),看它會不會給出同樣的分數。結果:「會談流暢度」這一軸的重測一致性高達 0.96,值得信任;「洞察品質」是 0.78,堪用但必須知道它的手震。我們還算出了這把尺的最小可辨差異:樣本三十場時,小於某個幅度的「進步」根本量不出來——追逐那種進步等於追逐雜訊。從此每把尺都帶著自己的出廠編號,每個分數都知道自己是被哪把尺量的。

逐條審判督導。 然後是最重的一刀:把督導據以扣分的十三條條文攤開,一條一條問三個問題——這條規則誰在執行?真的有執行嗎?執行的結果站得住嗎?審下來:一條規則從頭到尾沒有影響過任何一個分數(它等待的情境從未出現);一條名義上交給督導執行、實測督導根本沒在執行,反而是另一段程式默默在扣同一筆帳——同一個缺點被扣兩次。最後我們改寫了督導的判詞條文,上線前後對照:假的「停滯」宣稱從 78% 降到 43%,而真的停滯 78% 變 80%,一句都沒少寫。

會談實例:把他說過的話還給他

客戶:「這兩週我至少把履歷改完、投出去了。雖然還是很怕。」

扭曲的鏡子:「聽起來你還是卡在原地。我們來看看是什麼讓你停滯這麼久?」

準確的鏡子:「你說『至少把履歷投出去了』——這是兩週前你還不敢做的事。怕還在,腳步也在。你想先看哪一個?」

第一種回應把「怕」放大成「停滯」,把教練自己的判詞縫進了客戶的故事;第二種什麼都沒有添加,只是把他真的說過的兩端擺回他眼前,讓他自己檢視。我們這兩週做的所有事,本質上只有一件:教系統的督導,做第二種事。


得|成果與心得

具體成果:開跑前體檢成為每個實驗的必經之路;一把通過重測考驗的細尺上線;十三條扣分條文有了治理表,每條都有主人、有出處;督導的判詞改寫上線,假停滯宣稱近乎減半。

開發心得:過去我們把「量」當成免費的動作——想知道就去量,量出來就相信。這兩週學會了每個數字背後要能回答三個問題:用哪把尺量的?這把尺穩嗎?這把尺量得到這件事嗎?三個問題任何一個答不出來,那個數字就不是證據,是裝飾。

也要誠實:假停滯還剩 43%——鏡子少說謊了,沒有不說謊。而距離「洞察品質 0.80」那顆北極星,這把誠實的新尺量出來的位置,比舊尺告訴我們的更遠。看清楚自己在哪裡,是這一章唯一但扎實的前進。

給教練的反問:你上一次給客戶的回饋——或督導給你的——能指出是聽到哪一句話才那樣說的嗎?


下一章預告:尺修好之後,它照出的第一件事,是我們一直量錯了對象。