CyberQ 賽博客
沒有結果
觀看所有搜尋結果
  • 首頁
    • 關於我們
    • 隱私權政策
  • 熱門
  • AI 人工智慧
    • AI 應用實戰
    • AI 代理
  • 資安
    • ISO 合規
  • Docker
    • 虛擬化
  • 進階應用
    • DevOps
    • 程式開發
    • 企業解決方案
  • 網通
    • 100GbE
    • 10GbE
  • NAS
  • 開箱測試
    • 選購指南
  • 教學
    • DR.Q 快問快答
  • 展覽直擊
聯繫我們
  • 首頁
    • 關於我們
    • 隱私權政策
  • 熱門
  • AI 人工智慧
    • AI 應用實戰
    • AI 代理
  • 資安
    • ISO 合規
  • Docker
    • 虛擬化
  • 進階應用
    • DevOps
    • 程式開發
    • 企業解決方案
  • 網通
    • 100GbE
    • 10GbE
  • NAS
  • 開箱測試
    • 選購指南
  • 教學
    • DR.Q 快問快答
  • 展覽直擊
沒有結果
觀看所有搜尋結果
CyberQ 賽博客
沒有結果
觀看所有搜尋結果
  • 首頁
  • 熱門
  • AI 人工智慧
  • 資安
  • Docker
  • 進階應用
  • 網通
  • NAS
  • 開箱測試
  • 教學
  • 展覽直擊
首頁 進階應用 AI 應用實戰

能自動分類就不要依賴生成,參考 JEV 概念實作本機小模型當決策判斷引擎

Icewind by Icewind
2026 年 09 月 21 日 12:33
in AI 應用實戰, 進階應用
閱讀時間: 4 分鐘
A A
能自動分類就不要依賴生成,參考 JEV 概念實作本機小模型當決策判斷引擎
131
觀看數
分享到臉書分享到 X分享到Line分享到 Threads分享到 Linkedin

大部分企業內部的 AI 任務,最後只是要一個簡端判斷,這封信要不要回、這筆告警要不要叫醒值班、這段回覆該轉給哪個部門、這份摘要跟原文一不一致。這些任務的答案是有限選項中的一個,但我們習慣的做法仍然是叫語言模型「寫」出答案,然後再去解析它寫了什麼,這無型中會浪費掉很多不必要的計算和電力消耗,

RELATED POSTS

QNAP 新版 HDP for Business 與虛擬機工作站:企業備份納入集中管理,啟動驗證與 Intel Arc Pro 直通

DeepSeek-V4.1-Flash 雙機 GB10 搭配 QNAP NAS 儲存架構實測

在地端打造 AI 出圖工作站:QNAP NAS 部署 ComfyUI 實戰紀錄與 Krea 2 工作流解析

最近看到有人示範另一種做法,放棄用文字生成來處理這些事情,只讀模型對候選答案的機率。我在自己的兩台 NVIDIA DGX Spark 上完整做了一次,包含蒸餾、人工複核與延遲量測。結論雖然和我原本預期的不同,但是卻更有用。

Jevも合成データと大規模モデルのラベルで学習をしているらしいので、重み157GBのDeepSeek V4 Flashの判断をDGX Sparkで26時間かけて蒸留・学習し、4Bモデルに移してみた。20分の1のサイズで教師の即答モードを超え、1判断あたり約22ms。Local LLMだけでここまでできるとは。 https://t.co/2I4pcnskVf pic.twitter.com/wfAlYiCnmM

— Taro L. Saito (@taroleo) September 19, 2026

判斷與生成是兩件事

一般的推論流程是這樣:

prompt → prefill → token1 → token2 → token3 → ...

就算你只想知道「是」或「否」,模型仍然可能先寫「根據上述情況,我認為」,這些 token 全部都是延遲。

改成判斷專用之後:

prompt → prefill → 讀最後一個位置的 logits → 結束

假設候選答案對應到 A、B、C、D 四個 token,取出這四個位置的 logits 做 softmax:

A: 97.5%   B: 2.0%   C: 0.4%   D: 0.1%

模型根本不必真的輸出 A。這等於把生成式模型當成判別式分類器用。

有三個實作細節決定成敗:

候選標籤必須是單一 token

中文選項幾乎一定會被切成多個 token,機率會被切碎,所以要用代號(A、B、C 或 1 到 5),並且用 tokenizer 實際驗證每個代號接在答案前綴後都只佔一個 token。

同一份資料的多個問題要共用前綴

把情境放在前面、問題放在後面,前綴的 KV 只算一次,每多一題只付後綴的計算。我這次量到 prefill 63 毫秒、每多一題約 32 毫秒。

選項順序要隨機化

否則模型會學到位置偏好,而不是內容判斷。

實驗設定

教師模型是 DeepSeek V4.1-Flash,以 EXL3 2.9bpw 量化後跨兩台 DGX Spark 做張量平行。學生模型是 Qwen3-4B-Instruct-2507,bf16,用 LoRA(r=32,掛在全部線性層,可訓練參數 6606 萬)微調。

題型照抄 TypeSafe AI 的 Jev 這個商用判斷模型的公開介面,是非題(noul)、單選題(choice)、評分題(score)。資料由教師自己合成,涵蓋 20 個領域,繁體中文與英文混合,共 4000 個情境、9987 題,其中約一半刻意設計成困難案例。

標籤有兩種來源。即答模式直接取 logprobs 當軟標籤,涵蓋全部 9987 題,思考模式取最終答案,只做了 3000 題,優先給測試集與驗證集,並且對即答信心低於 0.9 的題取樣三次做成投票分佈。

訓練 loss 只算答案位置、候選標籤 token 子集上的交叉熵,兩個 epoch 約四個半小時。

最重要的一個設計,另外做人工盲測。 我自己標了 253 題,不看任何模型的答案。這一步不能省,原因下面會講。

結果一:蒸餾沒有明顯提高準確率

組別人工隨機抽樣的準確率(n=105)
學生零樣本85.7%
學生蒸餾後87.6%
教師即答93.3%
教師思考95.2%

提升 1.9 個百分點,而 105 題的 95% 信賴區間大約是正負 4 到 5 個百分點。誠實的講法是:目前沒有足夠證據證明蒸餾提高了整體準確率。

學生也沒有超過教師即答。原因不難找:訓練資料裡只有 19% 有思考模式的標籤,其餘 81% 學的是即答模式,天花板自然就是即答。

如果只看這張表,這個實驗算是失敗。

結果二:蒸餾大幅改善了校準

指標零樣本蒸餾後
Brier0.2560.183
ECE0.1310.038

校準的意思很簡單,模型說自己有 90% 把握的那批題,實際上是不是真的答對九成。零樣本的模型過度自信,蒸餾後的模型則相當準確。

這比準確率多兩個百分點重要得多,因為它讓信心值可以拿來做決策。

結果三:可以攔下六成五的工作量

有了可信的信心值,就能設門檻,夠有把握的本機小模型自己答,沒把握的則轉給大模型處理,這是許多場域實際進行的實用方式。

門檻本機自理的比例自理題的準確率95% 區間
0.8072.1%97.8%0.937 到 0.992
0.9065.4%98.5%0.946 到 0.996
0.9555.2%99.1%0.949 到 0.998

串接起來看整體表現:

策略本機自理整體準確率期望延遲
全部交給大模型0%93.3%1413 ms
門檻 0.9065%92.4%604 ms
門檻 0.9555%93.3%766 ms

門檻設在 0.95 時,整體準確率跟全部交給大模型完全相同,但有 55% 的請求不必動用大模型,期望延遲降低 46%。

這才是這個架構真正的價值。問題在於 4B 小模型的 40 億參數有沒有比 6710 億大模型聰明,而是,它能不能可靠地攔下一半以上不需要大模型的工作呢 ? 答案是可以。

三種題型的門檻差很多

題型門檻 0.90 時能自理的比例
是非題89%
單選題81%
評分題27%

這張表透露一件事,小模型本來就很會做離散分類,是非與單選在零樣本就有九成以上,蒸餾能改善的空間有限,甚至因為 LoRA 動到了決策邊界而略微退步(單選 91.7% 掉到 88.9%,是非 97.5% 掉到 95.0%)。

評分題這領域則完全不同,1 到 5 分不是單純分類,模型必須學會「3 分和 4 分的界線在哪?」,那是教師模型的隱性偏好。所以評分題是唯一明顯進步的題型,62.1% 提升到 75.9%。

換句話說,蒸餾的其實不是知識,而是判斷的尺度,這點在實務上將確實有幫助。

兩個評測上的陷阱

第一,不能拿教師當標準答案。

學生是用教師訓練的,如果評測也用教師當標準,量到的是「學生有多像教師」,不是「學生有多正確」。這次的教師思考模式自己在人工複核下也只有 95.2%,所以學生的天花板本來就在那裡。第一版分析就踩到這個坑,在以教師為參考的保留集上挑門檻,會挑到 0.6,但那個門檻對人工答案只有 92% 準確。

第二,小心條件抽樣。

另外抽了 88 題「三個系統答案不一致」的題來看爭議情況,這一層所有系統的表現都掉到五成上下。但這個資料集是條件在「不一致」才入選的,不是自然分布,不能拿它的數字去代表任何系統的實際準確率。同理,專挑某個模型答錯的題去比較兩個模型,得到的結論沒有意義。

適合用小模型做的任務

只要答案是有限選項,而且不需要解釋,就非常適合採用這種小模型來工作:

客服工單路由、郵件分類

內容審核的通過、複審、封鎖

維運告警的嚴重度與是否需要叫醒值班

檢索結果與問題是否相關

代理人下一步該呼叫哪個工具

回覆品質的評分

這些任務沒有一個需要模型寫出一段自然語言。

實務上的建議

能分類就不要生成

一次前向傳遞加上讀 logits,可以把延遲壓到幾十毫秒的量級。

蒸餾不一定提升準確率,但可能大幅改善校準

對生產系統而言,可信的信心值常常比多兩個百分點的準確率有用。

蒸餾效果取決於教師訊號的種類,不只是教師模型有多強

用推理後的答案、即答的機率分佈、硬標籤或軟分佈,學到的是完全不同的東西。

評測一定要有獨立的標準答案

學生更像老師,不等於學生更正確。

最後補一個量測上的提醒。看到「每次判斷 22 毫秒」這類數字時,先問清楚起點和終點在哪。這次量到的單題端到端是 133 毫秒,但共用情境後的每題增量只有 32 毫秒,兩個都是真的,只是測試到的是不同的事,我們一般在業界軟體研發時,產品在乎的通常是前者。

攔下 65% 大模型工作量,小模型蒸餾是為了信心校準

企業導入 AI 的迷思,往往在於習慣性地將每個問題都當作寫作題,讓龐大的生成式模型去吐出一段自然語言,最後再寫一堆正規表達式苦苦解析。

CyberQ 這場實驗證明的核心價值,當然不是 4B 小模型有多強,而是小模型大模型分工作的機制,其實是具備一點「自知之明」的。當我們放棄生成、回歸 Logits 的機率本質,並透過蒸餾將校準誤差大幅壓低時,信心值便能轉化為高可靠度的決策閘道。

在真實的生產環境中,AI 工程構建一套務實的分流架構,讓在地執行的輕量引擎以數十毫秒的極致延遲過濾掉過半的工作量,大模型則退回後方扮演終極的仲裁者。我們設法去研究計算資源與電力消耗的最佳化,也希望讓 AI 系統走向穩定可靠生產工具。

ChatGPT 共同發明人推出 Jev 模型,每秒 10 次決策即時玩 Doom,每小時成本約 7 美元
標籤: AIJev地端AI小模型
Share2Tweet1ShareShareShare
上一篇

AI 巨頭放緩喊假的?|世界模型黑箱?|Qwen 開源新局|產業精選 09.21

Icewind

Icewind

歷經數位內容、電商、資安、AI 與科技產業,擁有多年產業經驗,ISO 27001:2022 LA、ISO 27701:2019 LA。

相關文章

QNAP 新版 HDP for Business 與虛擬機工作站:企業備份納入集中管理,啟動驗證與 Intel Arc Pro 直通
NAS

QNAP 新版 HDP for Business 與虛擬機工作站:企業備份納入集中管理,啟動驗證與 Intel Arc Pro 直通

2026 年 9 月 20 日
AI 應用實戰

DeepSeek-V4.1-Flash 雙機 GB10 搭配 QNAP NAS 儲存架構實測

2026 年 9 月 15 日
在地端打造 AI 出圖工作站:QNAP NAS 部署 ComfyUI 實戰紀錄與 Krea 2 工作流解析
Docker

在地端打造 AI 出圖工作站:QNAP NAS 部署 ComfyUI 實戰紀錄與 Krea 2 工作流解析

2026 年 9 月 6 日
自架 Headscale 上的 Collie:把手機接到自架算力節點的 AI 代理人
AI 應用實戰

自架 Headscale 上的 Collie:把手機接到自架算力節點的 AI 代理人

2026 年 9 月 2 日
自建 RustDesk 遠端連線 Server,並把畫面側錄納入合規流程
Docker

自建 RustDesk 遠端連線 Server,並把畫面側錄納入合規流程

2026 年 8 月 31 日
用手機看管家中的 AI 代理人,在 QNAP NAS 上以 Herdr、Collie 與 Tailscale 打造行動監控台
AI 應用實戰

用手機看管家中的 AI 代理人,在 QNAP NAS 上以 Herdr、Collie 與 Tailscale 打造行動監控台

2026 年 8 月 30 日

推薦閱讀

能自動分類就不要依賴生成,參考 JEV 概念實作本機小模型當決策判斷引擎

能自動分類就不要依賴生成,參考 JEV 概念實作本機小模型當決策判斷引擎

2026 年 9 月 21 日
AI 巨頭放緩喊假的?|世界模型黑箱?|Qwen 開源新局|產業精選 09.21

AI 巨頭放緩喊假的?|世界模型黑箱?|Qwen 開源新局|產業精選 09.21

2026 年 9 月 21 日
華倫提案禁止私募基金持有醫療診所,醫療商品化爭議不休

華倫提案禁止私募基金持有醫療診所,醫療商品化爭議不休

2026 年 9 月 21 日
Qwen-Image-2.1 開放權重下載,7B 單一模型整合生圖與編輯,授權改採研究授權

Qwen-Image-2.1 開放權重下載,7B 單一模型整合生圖與編輯,授權改採研究授權

2026 年 9 月 20 日
QNAP QSW 網管交換器 4.5.0 韌體實測

QNAP QSW 網管交換器 4.5.0 韌體實測

2026 年 9 月 20 日

近期熱門

  • 微軟緊急釋出 KB5129195 頻外更新,修補 9 月更新造成的 RDS 當機與 Hyper-V 問題,USB 音訊災情仍未完全解決

    微軟緊急釋出 KB5129195 頻外更新,修補 9 月更新造成的 RDS 當機與 Hyper-V 問題,USB 音訊災情仍未完全解決

    364 shares
    Share 146 Tweet 91
  • 商周集團網站遭攻擊一週仍未復原,主網域改導向 campaign 子網域

    265 shares
    Share 106 Tweet 66
  • AI什麼都能問,人類還需要背東西嗎?研究揭記憶仍是批判思考基礎

    246 shares
    Share 98 Tweet 62
  • ChatGPT 共同發明人推出 Jev 模型,每秒 10 次決策即時玩 Doom,每小時成本約 7 美元

    221 shares
    Share 88 Tweet 55
  • 揭開 Hacker News 排名演算法:評分、爭議與懲罰機制解析

    169 shares
    Share 68 Tweet 42
  • 從零打造自己的 Linux:Linux from Scratch

    164 shares
    Share 66 Tweet 41
  • Claude Code 開始讀取 AGENTS.md:跨工具協作時代來臨

    159 shares
    Share 64 Tweet 40
  • 用 40 億參數小模型改寫查詢計畫,速度比 Postgres 快上 81%

    153 shares
    Share 61 Tweet 38
  • Sakana AI 推出 Fugu Max 與 Fugu Ultra v2,視覺推論分數超越 Opus 5 與 Fable 5

    147 shares
    Share 59 Tweet 37
  • Hister:為你造訪過的網頁與收藏檔案而生的私有搜尋引擎

    140 shares
    Share 56 Tweet 35

關於 CyberQ 賽博客

CyberQ 賽博客網站的命名正是 Cyber + Q ,是賽博網路、資訊、共識 / 高可用叢集、量子科技與品質的綜合體。

我們專注於企業級網路與儲存環境建構、NAS 系統整合、資安解決方案與 AI 應用顧問服務。透過以下三大面向的「Q」核心元素,我們為您提供從基礎架構到資料智慧的雙引擎驅動力:

Quorum 與 Quantum-safe

在技術架構上,是基於信任的基礎架構,CyberQ 深入掌握分散式系統中的 Quorum(一致性)、Queue(任務調度) 與 QoS(服務品質),以 Quick(效率) 解決複雜的 IT 與資安問題。同時,我們積極投入 Quantum-safe(後量子密碼學) 等新興資安領域,確保企業基礎設施在未來運算時代具備堅不可摧的長期競爭力。

Query 與 Quotient

CyberQ 是協助企業成長的 AI 引擎,在堅韌的架構之上,我們透過 Query(洞察) 解析大量資料,並以 Quotient(提升企業科技智商) 的顧問服務,將 AI 導入本機端環境與自動化工作流程中,將資料轉化為企業最具價值的數位資產。

Quest與 Quantum Leap

專業媒體與技術顧問是我們的核心雙動能。

作為科技媒體,我們秉持駭客精神持續進行科技 Quest(探索),探索海內外產業動態。

作為顧問團隊,我們結合多年第一線實務經驗,提供量身打造的最佳化解決方案,協助企業完成數位轉型的 Quantum Leap(躍進)。

新聞稿、採訪、授權、內容投訴、行銷合作、投稿刊登:[email protected]
廣告委刊、展覽會議、系統整合、資安顧問、業務提攜:[email protected]

Copyright ©2026 CyberQ.tw All Rights Reserved.

沒有結果
觀看所有搜尋結果
  • 首頁
    • 關於我們
    • 隱私權政策
  • 熱門
  • AI 人工智慧
    • AI 應用實戰
    • AI 代理
  • 資安
    • ISO 合規
  • Docker
    • 虛擬化
  • 進階應用
    • DevOps
    • 程式開發
    • 企業解決方案
  • 網通
    • 100GbE
    • 10GbE
  • NAS
  • 開箱測試
    • 選購指南
  • 教學
    • DR.Q 快問快答
  • 展覽直擊

© 2025 CyberQ NAS、資安、資訊科技、AI應用的日常 關於 CyberQ 賽博客 NAS 系統與電腦、手機一起的生活故事 多年的系統整合與資訊安全經驗,協助智慧家居、小型工作室、辦公室與機構,導入更便利、更安全的資訊環境與應用。