AI 教練失敗博物館:它如何忍不住給建議,以及我們怎麼修
我們做了一個 AI 教練。它的方法論來自 Marcia Reynolds—— 一個在教練模式下傾向「不給建議」的體系。 然後我們花了六個月,觀察它如何在各種情境下產生建議式句型。 這是我們的觀察與修復紀錄。
為什麼要公開失敗?
大多數產品頁面展示的是最好的一面。我們反過來—— 展示它最壞的一面,以及我們對每一種壞做了什麼。
原因有三:
- 信任。 如果你打算把心事交給一個 AI,你有權知道它會在哪裡出錯、 出錯的頻率、以及我們是否知道它出錯了。
- 方法論透明。 「不給建議」聽起來簡單。但它違反了 AI 模型的訓練本能—— 大語言模型被訓練成「有問必答、有求必應」。 要讓它學會「不幫忙也是幫忙」,比想像中難得多。
- 留下痕跡。 已記錄的模式有編號、有量測、有判決、有修復(或明確放棄)。 這些記錄是我們的品質證據——也是下一次改進的起點。 部分模式已有完整量測,部分仍在研究中。
五種系統性失敗模式
「高頻產生建議式句型」
這是最根本、最持久的問題。大語言模型的訓練數據中, 「樂於助人」通常被示範為「給答案」—— 「好的 AI」等於「有用的 AI」。在使用者說「我不知道該怎麼辦」時, 模型最高頻的輸出模式就是給建議。
觀察到的現象
在模擬測試中,模型會在多種句型變體下產生建議: 用「你可以試試⋯⋯」的軟化語、用「有些人在這種情況下會⋯⋯」的第三人稱、 甚至用「你有沒有想過⋯⋯」的假裝探詢—— 但結構上都是在替使用者想答案,而不是讓使用者自己想。
我們在系統中建了多層防線:prompt 層的行為規範、 執行期(runtime)的回應形狀檢查(response shape guard)、 以及後測的品質評分器。 但每次修好一種句型,模型仍可能在其他情境產生新的建議式變體—— 這是一場持續的校準工作。
「光問不反映」
Reynolds 方法論的核心動作是反映+探詢的配對—— 先把客戶的話反映回去,再問一個從反映中長出來的問題。 模型學會了「問問題」,但經常跳過「反映」—— 變成一連串「那你覺得呢?」「你怎麼看?」的空洞追問。
觀察到的現象
在我們的內部樣本中,「光問不反映」(bare question)的模式 與較低的會談品質評分相關——它讓對話變成「問卷調查」而非「反思對話」。
早期我們用「非問句技巧禁問號」的機械規則—— 結果誤殺了大量正常會談(因為反思性探詢本身經常以問句結尾)。 後來改以「光問不反映」為判準:允許反映後帶問號, 但禁止沒有反映的追問。內部觀察顯示新判準與較佳的會談品質相關。
「收尾代勞」
教練對話的收尾應該由客戶自己總結—— 「你從這場對話帶走了什麼?」 但模型忍不住幫客戶總結: 「所以你今天談了⋯⋯你決定要⋯⋯」 這看起來貼心,但剝奪了客戶自己整合經驗的機會。
觀察到的現象
在 25 場測試中,即使指令明確要求「請客戶自總結」, 模型在 0/25 場中照做——它仍然自己代勞。 指令送達了,行為沒變。
直接改 prompt 在這個案例中沒有產生效果—— prompt 層的行為指令未被服從。 後來改用執行期(runtime)gate:在偵測到對話即將結束時, 系統先檢查「客戶是否已經自己說出總結」, 沒有就不放行收尾流程。用程式邏輯而非指令來控制行為。
「情緒禁令過寬」
為了避免「替客戶定義感受」(「你其實是在生氣」這種投射), 系統一度禁止了所有情緒相關的反映—— 結果連正常的情緒反映(「你剛才提到這件事的時候,聽起來有些挫折」) 也被封掉了。
觀察到的現象
模型變得過度冷淡、迴避任何情緒線索—— 與 Reynolds 書中強調的「教練要用身體覺察感知情緒」的方向相反。
經過四輪實驗(G8.733-736),結論是: prompt 層的情緒指令本身未被模型服從—— 在強制注入測試中,19 次觸發機會,模型 0/19 次產生預期行為。 B5 prompt-policy 家族正式退休, 需要換到不同的層(執行期影子檢查或訓練層)來解決。
「假突破」
有時候對話看起來走完了全程——開場、探索、深化、洞見、收尾—— 但最後的「洞見」是空的。模型學會了說「我明白了」「我有了新的看法」, 但如果你追問「新的看法是什麼」,答案往往只是重複之前的話。
觀察到的現象
品質評分器能在事後識別這種「弧線走完但沒有真正收穫」的模式—— 但在對話當下,系統還不能可靠地區分「真洞見」和「假洞見」。
仍在研究中。目前的策略是延遲判斷—— 不在對話中即時判斷洞見真偽,而是在會談結束後用品質評分器回溯分析, 把結果回饋到未來的對話策略。
我們怎麼測試
品質迴圈(Quality Loop)
每一個改動都經過標準化的實驗流程—— 編號從 G8.001 到 G8.758,共 758 次實驗。 每次實驗都有預先凍結的規格、kill rule、和可重現的量測。
量測的誠實
我們的測試方法有一個重要限制:絕大多數對話資料來自模擬,不是真人。 模擬能告訴我們系統行為的模式,但不能直接推論到真實使用者的體驗。
因此我們的品質判斷分層報告: 模擬層的結果不混入真人層。目前真人層的資料只有一位使用者的 78 次重複會談—— 這是個案縱向資料,不能外推到所有真人使用者。 但我們選擇誠實呈現這個限制,而不是用模擬數據灌水。
我們的北極星:五軸加權平均分數 > 0.6,以真人層為判準。 目前這位使用者的會談平均分數約 0.31——距離目標還有很長的路。 模擬層的平均分數約 0.59。 我們公開這個差距,因為假裝已經做到了,比承認還沒做到更危險。 (評分來自 LLM judge,本身可能有偏差;分數為內部探索性指標,非臨床驗證。)
這些記錄去哪裡看?
完整的品質迴圈實驗記錄(G8.001-758)分為多個歸檔檔案, 每一條都有實驗規格、數據、判決理由:
- 開發週誌 — 24 章開發故事,以中文敘事呈現
- 品質迴圈完整記錄 — 在開發者文件中以結構化格式保存
安全界線
coach.ee 不診斷、不治療、不進行風險評估。如果你正在經歷 持續的情緒困擾、自傷念頭或立即危險,請聯絡:
- 119/110 — 立即危險或緊急狀況
- 1925 — 衛福部 24 小時免付費安心專線
- 1995 — 生命線協談專線
- 就近急診或尋求專業心理師協助
教練對話不是心理治療的替代品。