第 26 章意向圖:分數上升不是教練變好
Chapter 26 · measure

分數上升不是教練變好 — 先量清楚那把尺

2026 年 8 月 16 日 – 8 月 18 日

一個不知道自己的誤差有多大的量尺,會讓每一次進步看起來都像真的。

2026 年 8 月 16 日 – 8 月 18 日

三天。我們把判分的對象重新定義了一次、把尺換到第二版,然後做了一件以前從來沒做過的事:把同一批會談、同一把尺,獨立評兩次。結果,分數上升了 0.065——而上升的不是教練。同一批場次裡,四個軸的最大差距剛好是一個完整級距。這一章沒有讓任何一場會談變好,它只是把「進步」這兩個字,變得比從前更難說出口。


核心啟發

一個不知道自己的誤差有多大的量尺,會讓每一次進步看起來都像真的、每一次退步看起來都像意外。在被量測之前,任何數字都只是印象。而願意承認「我原本可能看錯」,是你唯一能看得更深的入口。


觀|思維

Reynolds 在客戶找不到詞的時候,給教練一個看起來很冒險的建議:

「Being wrong can prompt them to think more deeply about their thoughts and feelings.」

(願意犯錯,反而會讓他們把自己的想法與感受想得更深。)

書上的操作是這樣:如果客戶找不到話說,你就把他說過的內容簡短地收攏一遍,把你以為的意思講出來,然後讓他自己補充或修正。說錯了不是失誤——客戶會糾正你,而糾正的那一刻,他對自己的理解反而更清楚。

這一章,我們把這句話的對象換成自己。過去幾個月,我們一直把「教練表現不好」當成事實,照著那個事實安排一個又一個案子。直到這三天願意承認另一種可能:看的人是我們,尺也在我們手上,那有沒有可能是我們看錯了? 承認這一點之後,同一批會談才長出完全不同的意思。


為|實務與實現

先換掉分母。 起點是一個很笨的問題:被判「表現不好」的那些會談,有多少是根本還沒被看的?答案寫在評分模型的評語裡,而且是我們自己寫進去的規則:一場會談如果少於八輪、或從來沒有走到「洞察」那一層,各項一律給低分,理由是「無法充分評估」。也就是說,那把尺自己承認它沒看到東西,卻照樣發了分數,而這些分數,一直被算進我們要優化的平均裡。

於是第一個決定很單純:把「可以評分」定義清楚(至少八輪、而且真的走到過深處),北極星只看這一群。以八十一場真實會談為例,合格的只有四十五場,佔 55.6%,平均 0.4369,距離 0.6 還差 0.163。剩下那三十六場照樣公布,但不列入被優化的平均。那套舊的計分方式其實不是在量教練的品質,是在量會談長度的分佈。

再換掉尺本身。 同一天,判分用的規則換到第二版,然後我們做了一件這個專案從未做過的事:把同一批八十一場會談,用第一版與第二版各評一次,場次一對一配對。結果是總分平均上升 0.0653。

這個數字如果單獨拿出來報告,會是一則好消息:系統一夜之間進步了六分半。但因為我們做了配對對照,它有了正確的名字:那把尺不再低報了,不是教練變好了。 兩件事在帳面上長得一模一樣,只有配對才分得開。這是這一章第一個真正的收穫:換尺的那一天,你必須同時知道自己在換尺。

然後量尺自己的手抖。 更難的一步在後頭:同一把尺、同一批四十五場、各自獨立評兩次。總分的平均差是 −0.0047,標準差 0.0223,單場最大差 0.08。四個軸的最大差,剛好都是 0.20——剛好等於尺的一個完整級距。

於是我們第一次知道自己看得到多細:比 0.02 左右的差距讀不出訊號;單一軸比一個級距小的差距,讀不出訊號。從此以後,任何「某個維度掉了 0.18」的說法都可以被一句話打回去:那是我們自己的手抖。在這之前,我們其實一直在用一把沒有標示刻度的尺。

再往下,挖到規則自己在砍不該砍的東西。 盤點那條「無法充分評估就給低分」的規則時,使用者點出了一個我們自己沒看見的邏輯破洞:那條規則說的「各項」,指的是全部五個軸——包含兩個從會談第一輪就看得見、跟「有沒有走到深處」完全無關的軸。實際量起來,沒受限制的會談在技術多樣性上的平均是 0.5378,比那條規則訂的上限 0.4 還高;而被限制的那一群,刻度被硬生生從五個值壓成三個值,三十六場裡有十九場卡在上限。

更關鍵的是另一半:設限不等於失敗。 有人會直覺認為被壓低分數的短會談一定推得比較慢,但實際的推進效率反而略快(每一輪前進的相位數 0.1667 對 0.1519)。所以正確的修法不是重新配權重——那會反過來把短會談的分數灌高——而是「沒看到的地方才設限,看到了就一律覆寫」。這一刀是使用者下的,也提醒了我們:規則的漏洞往往不在它量了什麼,而在它沒看見卻仍給分。

同一段時間的其餘四件事。 我們在同一批工作裡把另外四件基礎工程做完:把五軸的人工金標樣本框出來(供以後換尺重新定基,只凍結樣本、不標註);把「怎麼定義達標」的三層判定重算一次;審計系統裡哪些欄位是真正被讀取的(這件事的結果在上一章);以及順手把一個憑證外洩的風險從原始碼裡拔掉。

再往下,算出要等多久。 有了誤差,才能算樣本。要在雙臂比較裡穩定看出 0.10 的差距,需要每個手臂三十二場;而真實會談每月累積約十七場、其中可評分的約十場。合起來,一個足以分辨 0.10 的實驗,大約要等半年。這個數字的意義不小:這半年不是因為母體不夠大,而是因為累積速度就是這麼慢。同時它也定下了另一條紀律:可評分比例只能當護欄,不能當目標——因為「一場會談什麼時候算結束」的操作定義,就是「客戶三十分鐘沒有回話」。去優化它,等於是把想離開的人留在會談裡。

會談實例:六十分是一個尺的數字

客戶:「這次回饋只有六十分。我想我大概就是不適合做這件事。」

照著分數走:「那我們來看看,六十分裡缺的是哪幾塊?你下一個版本打算怎麼補?」

照著人走:「六十分是一把尺給的數字。你自己從這件事裡看見的——是『這條路不適合我』,還是『我還沒找到方法』?」

第一種回應把分數當成事實,然後開始優化分數;客戶原本想談的是自己,被留下來繼續面對那把尺。第二種回應先把尺與人分開,再把問題放回他手上——而且問的正是他剛剛親口說的兩種可能。

這一章我們在系統身上做的,是同一件事的另一個方向:當那把尺說了「這個人不行」,你要先問的是它到底有沒有看清楚。分數不是判決,分數是一個有誤差的觀察。你不先把誤差量出來,就會把尺的手抖當成客戶的表現。


得|成果與心得

具體成果:北極星母體改為「可評分場次」——四十五場、佔 55.6%、基準 0.4369、缺口 0.163;判分規則換到第二版並完成配對歸因(+0.0653 是尺不再低報,不是教練變好);量尺自身的重測誤差首次量出(整體標準差 0.0223、單軸級距 0.20);計分規則誤砍兩個無關軸的漏洞被指出並改寫修法方向;一個足以分辨 0.10 差距的實驗,所需樣本與所需月數首次算清,大約是半年;另外完成了金標樣本凍結、達標判定的三層重算、承重欄位審計、以及一處憑證外洩的移除。

開發心得:這三天一個新的行為都沒有上線,一句新的教練台詞都沒有寫,北極星也一步都沒有靠近。我們做的事情,是讓「我們有沒有在進步」這個問題,第一次變成一個可以被誠實回答的問題。在此之前,任何進步的宣稱都可以被三個反問拆掉:你算進去的場次是能被評分的嗎?你換尺了嗎?你的差距大於你自己的誤差嗎?現在這三題都有答案了。

也誠實記下一件不太舒服的事:我們花了幾個月朝一個數字努力,那個數字有 44% 的時間在量根本不該被量的場次。這不是誰的疏忽,是沒有人一開始就問「這把尺在什麼情況下等於沒有看」。

給教練的反問:你最近一次用一個分數、一份評語或一個結果評價自己,是什麼時候?在那之前,你量過那把尺嗎?


下一章預告:尺標好了,第一批實驗跟著開跑。三條路線先後被判死——而且三種死法,長得完全不一樣。

讀 Reynolds

讀 Reynolds|先量自己看錯了多少

三天。我們把評分的對象重新定義一次(先把「根本還沒被看清」的會談從平均裡拿出來),接著把尺換到第二版,再把同一批會談用兩把尺各評一次。配對之後,分數上升了 0.065——上升的不是教練,是那把尺不再低報。然後我們做了一件從來沒做過的事:同一把尺、同一批場次,獨立評兩次。四個軸的最大差距,剛好是一個完整的級距。

Marcia Reynolds 在談「捕捉與放下判斷」時,把誠實放在第一步:在當下評估你感覺到什麼,不要依賴記憶;對自己誠實,因為你的答案沒有對錯。

「Assess what you are feeling in the moment instead of relying on memory. Be honest with yourself; nothing is right or wrong about your answers.」

(在當下評估你感覺到的,不要依賴記憶。對自己誠實,你的答案沒有對錯之分。)

(章節標註:BC Ch. 4)

「對自己誠實」之所以難,是因為你必須先承認自己可能一直看錯了。這一輪我們承認的事很具體:過去幾個月用來衡量進步的那把尺,有 44% 的時間在量根本不該被量的場次。承認之後,我們第一次知道自己看得到多細——比 0.02 小的差距讀不出訊號,單一軸比一個級距小的差距也讀不出來。

給臺灣的教練:你最近一次用一個分數評價自己或客戶,是什麼時候?在那之前,你量過那把尺嗎——你知道它的誤差有多大嗎?

讀完了?如果你也想試試不給建議的對話——

加入 LINE 開始對話