# 第二十六章：分數上升，不是教練變好 — 先量清楚那把尺

**2026 年 8 月 16 日 – 8 月 18 日**

> 三天。我們把判分的對象重新定義了一次、把尺換到第二版，然後做了一件以前從來沒做過的事：**把同一批會談、同一把尺，獨立評兩次**。結果，分數上升了 0.065——而上升的不是教練。同一批場次裡，四個軸的最大差距剛好是一個完整級距。這一章沒有讓任何一場會談變好，它只是把「進步」這兩個字，變得比從前更難說出口。

---

## 核心啟發

一個不知道自己的誤差有多大的量尺，會讓每一次進步看起來都像真的、每一次退步看起來都像意外。在被量測之前，任何數字都只是印象。而願意承認「我原本可能看錯」，是你唯一能看得更深的入口。

---

## 觀｜思維

Reynolds 在客戶找不到詞的時候，給教練一個看起來很冒險的建議：

> 「Being wrong can prompt them to think more deeply about their thoughts and feelings.」
>（願意犯錯，反而會讓他們把自己的想法與感受想得更深。）

書上的操作是這樣：如果客戶找不到話說，你就把他說過的內容簡短地收攏一遍，把你以為的意思講出來，然後讓他自己補充或修正。說錯了不是失誤——客戶會糾正你，而糾正的那一刻，他對自己的理解反而更清楚。

這一章，我們把這句話的對象換成自己。過去幾個月，我們一直把「教練表現不好」當成事實，照著那個事實安排一個又一個案子。直到這三天願意承認另一種可能：**看的人是我們，尺也在我們手上，那有沒有可能是我們看錯了？** 承認這一點之後，同一批會談才長出完全不同的意思。

---

## 為｜實務與實現

**先換掉分母。** 起點是一個很笨的問題：被判「表現不好」的那些會談，有多少是**根本還沒被看**的？答案寫在評分模型的評語裡，而且是我們自己寫進去的規則：一場會談如果少於八輪、或從來沒有走到「洞察」那一層，各項一律給低分，理由是「無法充分評估」。也就是說，那把尺自己承認它沒看到東西，卻照樣發了分數，而這些分數，一直被算進我們要優化的平均裡。

於是第一個決定很單純：把「可以評分」定義清楚（至少八輪、而且真的走到過深處），北極星只看這一群。以八十一場真實會談為例，合格的只有四十五場，佔 55.6%，平均 0.4369，距離 0.6 還差 0.163。剩下那三十六場照樣公布，但不列入被優化的平均。那套舊的計分方式其實不是在量教練的品質，是在量**會談長度的分佈**。

**再換掉尺本身。** 同一天，判分用的規則換到第二版，然後我們做了一件這個專案從未做過的事：把同一批八十一場會談，用第一版與第二版各評一次，場次一對一配對。結果是總分平均上升 0.0653。

這個數字如果單獨拿出來報告，會是一則好消息：系統一夜之間進步了六分半。但因為我們做了配對對照，它有了正確的名字：**那把尺不再低報了，不是教練變好了。** 兩件事在帳面上長得一模一樣，只有配對才分得開。這是這一章第一個真正的收穫：換尺的那一天，你必須同時知道自己在換尺。

**然後量尺自己的手抖。** 更難的一步在後頭：同一把尺、同一批四十五場、各自獨立評兩次。總分的平均差是 −0.0047，**標準差 0.0223**，單場最大差 0.08。四個軸的最大差，剛好都是 0.20——剛好等於尺的一個完整級距。

於是我們第一次知道自己看得到多細：比 0.02 左右的差距讀不出訊號；單一軸比一個級距小的差距，讀不出訊號。從此以後，任何「某個維度掉了 0.18」的說法都可以被一句話打回去：那是我們自己的手抖。**在這之前，我們其實一直在用一把沒有標示刻度的尺。**

**再往下，挖到規則自己在砍不該砍的東西。** 盤點那條「無法充分評估就給低分」的規則時，使用者點出了一個我們自己沒看見的邏輯破洞：那條規則說的「各項」，指的是**全部五個軸**——包含兩個從會談第一輪就看得見、跟「有沒有走到深處」完全無關的軸。實際量起來，沒受限制的會談在技術多樣性上的平均是 0.5378，比那條規則訂的上限 0.4 還高；而被限制的那一群，刻度被硬生生從五個值壓成三個值，三十六場裡有十九場卡在上限。

更關鍵的是另一半：**設限不等於失敗。** 有人會直覺認為被壓低分數的短會談一定推得比較慢，但實際的推進效率反而略快（每一輪前進的相位數 0.1667 對 0.1519）。所以正確的修法不是重新配權重——那會反過來把短會談的分數灌高——而是「**沒看到的地方才設限，看到了就一律覆寫**」。這一刀是使用者下的，也提醒了我們：規則的漏洞往往不在它量了什麼，而在它**沒看見卻仍給分**。

**同一段時間的其餘四件事。** 我們在同一批工作裡把另外四件基礎工程做完：把五軸的人工金標樣本框出來（供以後換尺重新定基，只凍結樣本、不標註）；把「怎麼定義達標」的三層判定重算一次；審計系統裡哪些欄位是真正被讀取的（這件事的結果在上一章）；以及順手把一個憑證外洩的風險從原始碼裡拔掉。

**再往下，算出要等多久。** 有了誤差，才能算樣本。要在雙臂比較裡穩定看出 0.10 的差距，需要每個手臂三十二場；而真實會談每月累積約十七場、其中可評分的約十場。合起來，一個足以分辨 0.10 的實驗，大約要等**半年**。這個數字的意義不小：這半年不是因為母體不夠大，而是因為**累積速度就是這麼慢**。同時它也定下了另一條紀律：可評分比例只能當護欄，不能當目標——因為「一場會談什麼時候算結束」的操作定義，就是「客戶三十分鐘沒有回話」。去優化它，等於是把想離開的人留在會談裡。

### 會談實例：六十分是一個尺的數字

> 客戶：「這次回饋只有六十分。我想我大概就是不適合做這件事。」

> **照著分數走**：「那我們來看看，六十分裡缺的是哪幾塊？你下一個版本打算怎麼補？」

> **照著人走**：「六十分是一把尺給的數字。你自己從這件事裡看見的——是『這條路不適合我』，還是『我還沒找到方法』？」

第一種回應把分數當成事實，然後開始優化分數；客戶原本想談的是自己，被留下來繼續面對那把尺。第二種回應先把尺與人分開，再把問題放回他手上——而且問的正是他剛剛親口說的兩種可能。

這一章我們在系統身上做的，是同一件事的另一個方向：當那把尺說了「這個人不行」，你要先問的是**它到底有沒有看清楚**。分數不是判決，分數是一個有誤差的觀察。你不先把誤差量出來，就會把尺的手抖當成客戶的表現。

---

## 得｜成果與心得

具體成果：北極星母體改為「可評分場次」——四十五場、佔 55.6%、基準 0.4369、缺口 0.163；判分規則換到第二版並完成配對歸因（+0.0653 是尺不再低報，不是教練變好）；量尺自身的重測誤差首次量出（整體標準差 0.0223、單軸級距 0.20）；計分規則誤砍兩個無關軸的漏洞被指出並改寫修法方向；一個足以分辨 0.10 差距的實驗，所需樣本與所需月數首次算清，大約是半年；另外完成了金標樣本凍結、達標判定的三層重算、承重欄位審計、以及一處憑證外洩的移除。

**開發心得**：這三天一個新的行為都沒有上線，一句新的教練台詞都沒有寫，北極星也一步都沒有靠近。我們做的事情，是讓「我們有沒有在進步」這個問題，第一次變成一個可以被誠實回答的問題。在此之前，任何進步的宣稱都可以被三個反問拆掉：你算進去的場次是能被評分的嗎？你換尺了嗎？你的差距大於你自己的誤差嗎？現在這三題都有答案了。

也誠實記下一件不太舒服的事：我們花了幾個月朝一個數字努力，那個數字有 44% 的時間在量根本不該被量的場次。這不是誰的疏忽，是沒有人一開始就問「這把尺在什麼情況下等於沒有看」。

給教練的反問：你最近一次用一個分數、一份評語或一個結果評價自己，是什麼時候？在那之前，你量過那把尺嗎？

---

*下一章預告：尺標好了，第一批實驗跟著開跑。三條路線先後被判死——而且三種死法，長得完全不一樣。*
