# 第二十一章：先審鏡子 — 判官自己也要被判

**2026 年 7 月 21 日 – 8 月 4 日**

> 兩週。我們用來檢驗品質的量測工具，自己兩度被判「量測無效」；三十場模擬會談白跑，只因一道品質門檻在開跑之前就不可能被通過；然後是一場對督導的逐條審判——十三條扣分條文，一條從未影響過任何一個分數，一條名義上指派了、實測從未執行。最後，我們改寫了督導口中最常見的那句假話。這一章只回答一個問題：你用來看見品質的那面鏡子，自己準嗎？

---

## 核心啟發

鏡子不先受檢，所有「進步」與「退步」都只是鏡子的心情。教練也一樣：你給回饋的能力，上限就是你聽的準確度——說得出「我是聽到哪一句才這樣說」的回饋，才有資格被稱為觀察；說不出的，是投射。

---

## 觀｜思維

Reynolds 在談反映式探詢時，把教練的角色講得很物理：

> 「When people hear their own words spoken, their ideas and beliefs are laid out in front of them to examine.」
>（當人們聽見自己說過的話被說出來，他們的想法與信念就攤在眼前，可以被檢視。）

反映的全部力量，建立在一個前提上：你放回去的，必須真的是他說過的。多加一個字的詮釋，鏡子就開始扭曲——客戶檢視的不再是自己的想法，而是你的。

我們的系統裡也有一面這樣的鏡子：每場會談結束後，有一位「督導」（評分判官——不是人，是一個獨立的評分模型）替會談打分數、寫評語。整個品質迴圈都靠它的眼睛。而這兩週我們發現：它最常寫的一句評語——「會談停滯」——在對照人類判讀時，有將近八成是冤枉的。鏡子在說謊，而我們照著這面鏡子調整了好幾個月。

---

## 為｜實務與實現

**連驗鏡子的工具，也要先過自己的檢驗。** 這一章開場的兩個「量測無效」，值得先交代。我們曾試著打造一個「讀判詞的儀器」——讓另一個模型自動判讀督導評語的對錯，作為第二層把關。它兩度沒能通過自己**事前訂好**的關卡：第一次錯放了不該放的判詞，第二次在一組埋好的考題上集體答錯。兩次，我們都照著事前的條款直接關案——不調門檻、不改標準答案、不給第三次機會。聽起來浪費，其實是這一章全部工作的地基：一個沒通過檢驗的檢驗工具，比沒有工具更危險，因為它會給你「已經檢查過了」的錯覺。

**先確定門開得了，再開跑。** 這一章的第一個教訓很貴：我們設了一道品質門檻，用「洞察品質」這個維度當主判，要求超過 0.80 才算通過——然後跑了三十場模擬會談、花掉三個半小時，才發現這個維度在六百多筆歷史紀錄裡**從來沒有超過 0.80**。門在開跑之前就是死的，跑它只是花錢演戲。於是我們做了一個「開跑前體檢」（前置檢查，pre-flight）：任何實驗開跑前，先機械地確認它要跨的門檻在歷史上是可能被跨過的。答案早就在資料裡，只是從來沒有人在花錢之前先問。

**尺要先量自己。** 接著我們換上一把刻度更細的尺，但這次不急著用——先讓它把同一批會談量兩次（重測信度，test-retest），看它會不會給出同樣的分數。結果：「會談流暢度」這一軸的重測一致性高達 0.96，值得信任；「洞察品質」是 0.78，堪用但必須知道它的手震。我們還算出了這把尺的最小可辨差異：樣本三十場時，小於某個幅度的「進步」根本量不出來——追逐那種進步等於追逐雜訊。從此每把尺都帶著自己的出廠編號，每個分數都知道自己是被哪把尺量的。

**逐條審判督導。** 然後是最重的一刀：把督導據以扣分的十三條條文攤開，一條一條問三個問題——這條規則誰在執行？真的有執行嗎？執行的結果站得住嗎？審下來：一條規則從頭到尾**沒有影響過任何一個分數**（它等待的情境從未出現）；一條名義上交給督導執行、實測督導根本沒在執行，反而是另一段程式默默在扣同一筆帳——同一個缺點被扣兩次。最後我們改寫了督導的判詞條文，上線前後對照：假的「停滯」宣稱從 78% 降到 43%，而真的停滯 78% 變 80%，一句都沒少寫。

### 會談實例：把他說過的話還給他

> 客戶：「這兩週我至少把履歷改完、投出去了。雖然還是很怕。」

> **扭曲的鏡子**：「聽起來你還是卡在原地。我們來看看是什麼讓你停滯這麼久？」

> **準確的鏡子**：「你說『至少把履歷投出去了』——這是兩週前你還不敢做的事。怕還在，腳步也在。你想先看哪一個？」

第一種回應把「怕」放大成「停滯」，把教練自己的判詞縫進了客戶的故事；第二種什麼都沒有添加，只是把他真的說過的兩端擺回他眼前，讓他自己檢視。我們這兩週做的所有事，本質上只有一件：教系統的督導，做第二種事。

---

## 得｜成果與心得

具體成果：開跑前體檢成為每個實驗的必經之路；一把通過重測考驗的細尺上線；十三條扣分條文有了治理表，每條都有主人、有出處；督導的判詞改寫上線，假停滯宣稱近乎減半。

**開發心得**：過去我們把「量」當成免費的動作——想知道就去量，量出來就相信。這兩週學會了每個數字背後要能回答三個問題：用哪把尺量的？這把尺穩嗎？這把尺量得到這件事嗎？三個問題任何一個答不出來，那個數字就不是證據，是裝飾。

也要誠實：假停滯還剩 43%——鏡子少說謊了，沒有不說謊。而距離「洞察品質 0.80」那顆北極星，這把誠實的新尺量出來的位置，比舊尺告訴我們的更遠。看清楚自己在哪裡，是這一章唯一但扎實的前進。

給教練的反問：你上一次給客戶的回饋——或督導給你的——能指出是聽到**哪一句話**才那樣說的嗎？

---

*下一章預告：尺修好之後，它照出的第一件事，是我們一直量錯了對象。*
