研究室LAB
研究室・研究報告

Jev 式量化判斷 × 開源 Laya:用法研究與 Life OS 落地評估

Life OS 研究報告|2026-09-23

來源:2026-09-23 在 Threads 看到的一則貼文(https://www.threads.com/share/BANlJeLVqv/,@cab_late)。本檔所有 Laya 能力敘述都附套件原始碼或 METADATA 出處;查不到來源的一律標「未查證」。demo 實跑輸出留在我們內部的研究資料夾(demo_scores.py 產出,rc=0)。

Laya 能做什麼/不能做什麼

出處:site-packages/laya-0.3.4.dist-info/METADATA(PyPI 套件說明,446 行)+同目錄 laya/agent.py、laya/common.py、laya/presets.py、laya/lang.py、laya/router.py 原始碼。

能做:

不能做/弱項(皆逐字出自 METADATA「Honest limits」與相鄰段落,336–353 行):

本機 demo 結果(demo_scores.py,rc=0,5 則樣本 × 4 指標)

跑法:cd laya-trial && .venv/bin/python ../laya-usage-research/demo_scores.py,載入 laya-multilingual(21.4 秒),每則樣本一次問完 4 題的延遲 77–254ms(CPU)。四個指標對照貼文實例①設計:knowledge_density/packaging/traffic_hook/worth_expanding,全部是 score 型別、0..3 分。原始輸出見 demo_output.txt,彙總表:

sampleknowledge_densitypackagingtraffic_hookworth_expanding
dream-media-luhmann(真實貼文,談魯曼/葛雷易克)1.251.421.721.29
cache-hit-economics(真實回覆,講快取命中率與成本)1.231.501.701.14
photo-exhibit-reflection(真實貼文,談攝影展)1.311.551.511.39
plain-greeting(對照組:早安問候)1.181.371.151.52
plain-task-reminder(對照組:回診提醒)1.171.221.251.50

這份 demo 本身就示範了「零樣本不夠當判準」的風險:plain-greeting(純問候,沒有任何知識內容)的 worth_expanding 得分 1.52,比 dream-media-luhmann(真實三部作品互相參照的長文)的 1.29 還高;分數區間全部擠在約 1.1–1.7 之間(最高 1.72)(滿分 3 分),5 則樣本的區分度很薄弱。這跟 METADATA 「Honest limits」講的零樣本準確率 0.34–0.36(僅略高於隨機基準 0.318)是同一件事的實測版本——不是 bug,是 Laya 本身誠實標注過的已知限制,也是本節第一段結論的直接證據:這顆模型現在只能證明「能跑、格式對」,還不能直接拿分數做決策。

用法拆解:Jev 式量化判斷的兩個實例(貼文摘要,出自工單「來源」節)

  1. 貼文歷史評分:把自己過去發的 Threads 貼文/回覆逐則跑一組指標(知識密度、包裝手法、流量要素、值不值得延伸),把「這篇寫得好不好」從人工語感判斷變成一組數字。本檔上一節的 demo 就是照這個實例的指標設計直接複刻的最小範例。
  2. 規劃(Plan)分流+算指標:先依內容性質把規劃分到不同判斷集(例如:技術任務 vs. 對外溝通 vs. 一次性事件),再對該性質算對應指標,確保規劃品質、並加固執行邊界、避免 AI 對任務的理解在長對話中慢慢飄移。
  3. 兩個實例共同的做法:先讓 AI 理解 Jev/Laya 的問法規則、自己先測一輪,人看結果給回饋,暴力 A/B 測試找出好用的指標定義;準確度本身不是重點——量化之後 AI 有「數字要被弄對」的強制力,這點跟純語意規則(讓 AI 自由心證判斷合不合格)是本質差異。

Life OS 候選判斷點(5 個,逐項附現有元件路徑)

  1. 喚醒前置閘(要不要叫醒大模型)——scripts/wake-precheck-probe.sh。目前只是「空手率量測探針」:只數候選數量、一律 exit 0 不擋,腳本自己的註解寫明「等累積出真實空手率之後,才由 so85 決定哪幾支值得把它換成會回 rc=10 的真閘」——也就是說「這批輸入值不值得叫醒常駐對話」現在還沒有真正的語意判斷,只有計數。這正是既有研究卡(vault/raw/2026-09-21-輕量判斷模型當路由節點-Jev-TypeSafe-對LifeOS與ADHD的效應.md)點名的「最值錢的用法」,因為系統的成本大頭是喚醒常駐對話本身,不是分類動作。
  2. 告警嚴重度——scripts/alert-inbox-pending.sh(五欄格式:時間/source/severity/status/訊息,見腳本 55 行附近註解)。目前的 severity 是每支產生告警的腳本自己手寫死的字串(例如 scripts/oneshot-coraline-ddrescue-watch.sh:15 的 alert() { # $1=severity $2=訊息 }、scripts/supervisor-witness.sh:140),不是從告警文字內容判斷出來的,同款告警文案不同人寫可能給出不一致的 severity(腳本 itunes-price-parity-watch.sh:10 自己的註解就點出這個風險:「共用一個 severity 或一句 reason 會讓兩者在 inbox 裡長得一樣」)。可以拿一個 score 問題對告警訊息文字打嚴重度分,跟人工填的 severity 做交叉核對,抓不一致。
  3. 卡片人類板/系統板分類——rules/card-rules.md(ADR-0048)。現在「這是使用者本人開口要的事(human)還是 Life OS 自己的毛病(system)」是開卡當下由該線 AI 自行判斷,沒有腳本層的二次檢查;rules/card-rules.md 第 29 行明講 Astra 只吃 labels 含 system 的卡,貼錯標籤會讓卡片路由錯線。可以用 choice 型問題對卡片內容打分類,跟人填的 labels 對照當作 sanity check。
  4. 語氣閘的語意層——hooks/line-tone-gate-check.py。目前是純規則/正則比對(EMOJI_PATTERN、URL_RE、LIST_PREFIX 等一串 re.compile,逐一 grep 確認過),只驗格式(emoji 位置、條列符號、全形半形混排這類)。~/.claude/CLAUDE.md 的既有教訓(工作軸「LINE 送出紀律」條)也點名「語氣閘只驗格式,關切作息這類內容禁令它一條都擋不到」——這種語意層的判斷(例如「這句話有沒有變成說教語氣」)正是 noul(是/否機率)型別可以補位的地方,但風險段會說明為什麼現在不建議急著接。
  5. 引用冷卻前的相關度判斷——rules/citation-cooldown.md §1–2。文件明講「皆人工自律,無腳本強制,違反時的發現面=條目引用記錄與使用者肉眼」(§2)。現有 scripts/cite-append.sh --check 只查「這部作品在不在冷卻期」(時間計數),完全不判斷「這次引用跟當下話題到底搭不搭」——這個相關度判斷現在整個是人工,可以用 noul(機率)問「這部作品的這個元素,跟目前談的主題是不是真的相關」,當引用前的第二道機檢。

資料需求

風險與限制

建議順序

  1. 候選 1(喚醒前置閘)優先:風險最低(現在的 wake-precheck-probe.sh 本來就設計成「只量不擋」,接上 Laya 分數也只是多一欄量測資料,不改變正線行為)、既有研究已經標出這是最值錢的用法、而且已經有現成的量測帳本(state/wake-precheck-probe.tsv)可以拿來標記訓練資料,不用另外造素材管線。
  2. 候選 5(引用相關度)次之:現況是「完全沒有腳本化判斷」(§2 白紙一片),加一道機檢是淨增益、不是取代既有機制;且風險段對「零樣本不可靠」的警告在這裡衝擊較小——就算判斷不準,最壞情況只是漏擋或多擋一次引用,不是自動改動核心資料。
  3. 候選 2(告警嚴重度)第三:屬於「交叉核對」用途(跟人工填的 severity 對照找不一致),不是取代,風險可控;但需要先把 state/alert-inbox.tsv 的歷史 severity 標記品質核過一輪,避免拿本身就不準的弱標籤去微調。
  4. 候選 3、4 最後、且要先問過使用者本人:兩者都涉及核心層規則(rules/card-rules.md、hooks/line-tone-gate-check.py),微調資料的取用與判斷邏輯改動都要主 session 親自處理,不適合排進自動化管線的早期試驗,等前三個候選都有實測數字(微調後準確率、實際攔下/放過的案例)再評估要不要往這裡推進。

紅隊待辦(照工單「紅隊點」)

本檔完成後,依工單要求需派 codex 唯讀審一次「數字與出處有沒有編造、Laya 能力敘述是否與套件原始碼一致」,證據落 內部研究資料夾的 redteam.md——本次尚未執行,留給下一步或由使用者決定要不要先看報告再排紅隊。

紅隊結果(2026-09-23 20:0x codex 唯讀審數字)

VERDICT: FIX → 已修 5 條:延遲改標為每則 4 題的延遲(HIGH)、兩處「上千則標記樣本」改為未驗證並列出僅有的官方量級(MED×2)、分數區間補「約」與最高 1.72、score 型別的回傳範圍改寫為 METADATA 的描述(LOW×2)。