結論:架構可借鑑,這版路由不能上線
老師的「小型型別化判斷 → 程式 RoutePolicy → 白名單內操作」適合作為設計原則。但這次把 Jev 式問法交給本機 Laya 後,93 題應載入技能的工作漏掉 90 題。雖然非技能訊息不再誤載技能,總體指標的提升主要是大量拒載造成的假進步。
請分清模型:本輪實際使用本機 Laya multilingual 0.3.4,採用 Jev 式問題拆分與程式政策;沒有呼叫老師的 TypeSafe Jev。這份報告不能用來推論真正 Jev 的準確率。
從課程取走什麼
Life-OS 的 Eric Jev 課程頁是根據老師資料改寫重組的學習摘要,不是逐字講義。第 2 課與第 3 課的 Northwind 示範讓 Jev 只輸出 Choice、Noul、Score 等決策值;由 C# RoutePolicy 處理訊號矛盾、授權、門檻、工具白名單和實際執行。同一輪的小問題共用精簡狀態,但互相看不到答案,因此衝突必須由程式整合。
第 5 課用主類別 Choice 搭配每個知識庫各一題 Noul,示範單庫、跨庫與資訊不足後追問,這可轉成 Life-OS 的多技能候選機制。該課 RagDemo 的 0.93 畫面明標 Simulated,不能當成真 Jev 的準確率。
第 4 課的第二保留集提供更重要的提醒:不使用 Jev 的工具選擇正確率是 94%;校準後 Jev B2 是 69%,錯誤追問 42%。因此 Life-OS 不能只追求低誤載或短延遲,還必須量漏判與錯誤追問。課程中的閾值是教學起點,不是本系統的校準值。
200 題怎麼測
沿用同一份固定題庫與 144 份唯讀技能快照:舊技能召回 60 題、口語改寫 40 題、真實訊息影子題 80 題、人工硬題 20 題。金標包括單技能 88、多技能 5、需要補語境 58、無新操作 30、直接工具 19。影子訊息原文、逐題結果與識別資訊都沒有放到這個公開頁面。
B 臂是原本的本機 Laya「前八候選技能+none」單選路由;C 臂保留相同題目、金標、候選與既有明點規則,改成一次批次詢問 1 個 Choice 與 11 個 Noul,再由事先寫好的程式政策合併。C 的小問題判斷新操作、缺少語境、多任務,以及八支候選的個別相關性。沒有足夠的歧義金標,因此這輪不把 Score 納入決策。C 的門檻是未校準的探索設定。
「嚴格安全路由」只納入 93 題技能工作與 49 題明確不該載技能的 none/tool 工作,排除 58 題單則訊息不足以判定的 ask。因此分母是 142;它檢查技能載入是否安全,不等於四分類路由準確率。
同題對照:少誤載,卻幾乎不載技能
| 指標 | B:單選 | C:型別化問題+RoutePolicy |
|---|---|---|
| 嚴格安全路由 | 32/142 | 52/142 |
| 應載技能題,至少命中一支 | 26/93 | 3/93 |
| 單技能題精確命中 | 24/88 | 2/88 |
| 多技能完整命中 | 0/5 | 0/5 |
none 誤載技能 | 28/30 | 0/30 |
ask 誤載技能 | 51/58 | 0/58 |
tool 誤載技能 | 15/19 | 0/19 |
| 候選檢索 recall@8(至少一支) | 53/93 | 53/93 |
| 模型已載入後有效路由 p50/p95 | 63/69 ms | 294/389 ms |
技能題至少命中一支
在全部 200 題上,C 的 skill/tool/ask/none 粗分類精確只有 62/200;19 題直接工具沒有一題回 tool。C 命中的 3 題全部來自原有明點規則,模型本身沒有促成技能載入。
為何看似進步,實際退步
配對後有 43 題「C 對、B 錯」,全是 B 把非技能訊息誤載成技能;另有 23 題「B 對、C 錯」,全是 C 漏掉技能。新政策的高分不是更懂需求,而是更常選擇不載入。
- 過度追問:C 的「缺語境」政策觸發 122/200,其中 56/93 是本應載入技能的工作。
- 新操作訊號偏低:技能題的「有新操作」Noul 中位數僅 0.1003。
- 候選分數缺鑑別力:八支候選中,每題通過相關門檻的中位數是 7/8;185 題至少四支過門檻。只挑最高分時,技能題仍僅 11/93 命中。
- 檢索上限仍低:正解至少一支出現在前八候選的比例僅 53/93。後段決策器不可能補回根本沒進候選的技能。
適合 Life-OS 的施工順序
這是依課程架構提出的 Life-OS 設計路徑,尚未接到正式入口。
- 程式先處理權限與明確訊號。辨識新請求、引文、否定與使用者明點;授權與不可逆操作的檢查留在程式層。
- 只給判斷器必要狀態。使用本輪訊息、已驗證的精簡上下文和已完成操作的收據;再問主類別、新操作、缺語境與多任務。
- 用薄目錄先粗分,再找候選。目錄包含穩定技能 ID、領域、正反觸發與路徑;允許多領域、多技能,不把現有章節當互斥類別。
- 由 RoutePolicy 合併小判斷。處理互相矛盾的訊號,決定追問、直接工具、無新操作或載入一至多支白名單技能;執行前仍檢查參數和權限。
- 用未見題驗收後再換開場入口。同時量候選召回、漏載、誤載、多技能完整命中、錯誤追問、端到端延遲和實際開場 token。
目前決策與研究限制
目前決策:不把這版 Laya 路由接上正式入口,也不因報告數字就縮掉現有入口資料。先改善前八候選召回,標註新的繁體中文測試題,固定校準集與完全未見的驗收集,再比較漏載與誤載。
這 200 題已被前一輪研究看過,是診斷性配對重跑,不是獨立保留集。題庫也沒有完整多輪狀態與引文信任標籤;本輪沒有測新的領域粗分、真正的 Jev、或開場 token 節省。測試中的影子訊息保持在本機,沒有送往雲端。
延伸閱讀:Jev 課程學習地圖、保留集與校準、多知識庫路由、課程來源說明。