本週重點
CyberQ 觀察,本週 GitHub 熱門專案的主線落在「型別化決策模型」的開源補位。TypeSafe AI 於 9 月 19 日正式發表 Jev,以託管 API 與候補名單形式提供,未公開權重與參數量。同一週內,開放權重的對照實作密集出現,Laya 在一週內累積超過兩萬三千顆星,衍生的 MLX 與 Core ML 移植把單題決策延遲壓到 5 至 14 毫秒區間,DeepOpen 則直接以 ModernBERT 與 mmBERT 為骨幹,在公開基準上與 Jev 逐項比較。
第二條主線是代理框架的工程化。Z.ai 釋出 ZCode 把終端、網頁與代理三種介面收斂成單一指令,unreal-agent 以可分叉的 append-only 會話儲存處理重放與去重,golive-skill 則把上線部署本身包成技能。
第三條線索來自散布形式,資安逆向與部署流程都改以 Agent Skill 的形態流通,技能庫的角色從輔助說明轉為可安裝的執行單元。
1. NandhaKishorM/laya,型別化決策模型引擎一週衝上兩萬三千星
https://github.com/NandhaKishorM/laya
建立於 9 月 18 日,一週內累積約 23,092 顆星與 1,985 次分叉,語言為 Python,採 Apache-2.0 授權,是本週星數增長最猛的專案。
Laya 把決策任務定義為三種型別化原語,分別是 choice(在候選項目上給出機率)、score(在序位評分表上定位)與 noul(對命題給出校準後的布林機率)。模型以單次前向傳播作答,不產生文字輸出,開發者訴求是藉此消除生成式模型的幻覺與格式漂移。訓練方法標示為 RLCD 嚴格適當評分規則,搭配 TD(lambda = 1.0) 的前綴建模處理時序信用分配。
README 列出的實測資料顯示,GPU 上單題 38.4 毫秒(p95 為 42.1 毫秒),10 題 156.0 毫秒,50 題 721.4 毫秒。準確率方面,整體 macro 為 83.8%,意圖路由 99.1%(ECE 0.009),內容審核 96.7%(ECE 0.061)。專案宣稱平均速度約為 TypeSafe Jev 的 10.4 倍,此為開發者自行量測。
模型可在一般 GPU、Mac MPS 或純 CPU 執行,以 pip install laya 安裝,權重放在 Hugging Face 的 convaiinnovations/laya。README 強調自架部署不產生資料外流。
2. zai-org/ZCode,把終端、網頁與代理收進同一個指令
https://github.com/zai-org/ZCode
建立於 9 月 20 日,五天內約 6,715 顆星與 2,004 次分叉,語言為 TypeScript,採 Apache-2.0 授權。
ZCode 是 Z.ai 推出的編碼代理框架,特色在於把桌面應用、瀏覽器環境與終端代理三種形態打包成同一份發行物。啟動邏輯統一在 zcode 指令下,不帶參數進入 TUI,第一個參數給 –web 則啟動網頁介面。專案支援透過 SSH 與 WSL 連線遠端專案,部署上可選本機、區網或以 token 驗證對外開放。
安裝方式為下載安裝腳本,預設將執行環境放在 ~/.zcode/runtime,並於 ~/.local/bin 建立指令符號連結。倉庫內含前端客戶端、後端服務、共用 UI 元件與代理 CLI 的執行環境原始碼。
3. mizorewww/laya-mlx,Apple Silicon 原生移植把短決策壓到 7 毫秒
https://github.com/mizorewww/laya-mlx
建立於 9 月 19 日,約 6,226 顆星與 478 次分叉,語言為 Python,採 Apache-2.0 授權。
這是 Laya 的獨立 MLX 移植版,以雙向編碼器架構在 Apple 的機器學習框架上重建推論路徑,需求為 Apple Silicon、Python 3.11 以上與 macOS 14 以上。測試機為 M3 Max,配置 40 個 GPU 核心與 128GB 記憶體。
FP16 精度下的實測結果,英文模型(421M 參數)單題短問題端對端中位數 13.42 毫秒,50 題批次吞吐為每秒 146.8 題。多語模型(322M 參數)中位數 7.39 毫秒,吞吐為每秒 395.0 題。峰值記憶體配置分別為 943.6 MiB 與 687.6 MiB。由於輸出 token 數為 0,逐字解碼的開銷被完全移除,這是延遲得以壓低的主因。
安裝以 pip install laya-mlx 完成,示範程式需另裝 laya-mlx[demo]。程式碼採 Apache-2.0,原始權重與架構的權利仍屬 Convai Innovations。
4. jev-chat/jev-chat-jarvis,裝在手機上的對話副駕
https://github.com/jev-chat/jev-chat-jarvis
建立於 9 月 21 日,四天內約 6,102 顆星與 1,098 次分叉,語言為 Kotlin,採 MIT 授權。
這個 Android 應用把決策模型接到即時通訊場景。運作分為三段,首先由各 App 的轉接器透過無障礙服務把聊天視窗轉成標準化的「標題加訊息列表」,在無障礙樹讀不到文字時自動截圖並以 ML Kit 中文模型在本機進行 OCR,不上傳影像。接著由判斷模型在約一秒內回答七個問題,涵蓋使用者意圖、危險等級(1 至 9 級)、對方訴求、建議動作與信心分數。最後由生成模型草擬三個候選回覆,再交回判斷模型排序,透過 ACTION_SET_TEXT 填入輸入框,必要時退回剪貼簿貼上,全程不會自動送出。
支援範圍為 QQ Android、X 私訊與飛書,其他 App 可用手動截圖 OCR。1.4 版起主動停止支援微信,README 說明原因是該平台對標準無障礙服務隱藏訊息文字,且在部分帳號與裝置上封鎖截圖。
隱私設計上,聊天內容僅在分析當下送往使用者自行設定的介面,不落地也不寫入日誌,憑證存放於應用私有目錄,歷史紀錄預設關閉,開啟後最多保留近 30 則。需求為 Android 11 以上,APK 約 27 MB,僅含 arm64-v8a,不需 root 也不需安裝模組。
5. unreallabsai/unreal-agent,以可分叉會話紀錄處理代理的重放問題
https://github.com/unreallabsai/unreal-agent
建立於 9 月 21 日,約 1,880 顆星與 97 次分叉,語言為 Go,採 MIT 授權。
Unreal Agent 主打非同步優先的代理框架設計,核心元件包含負責管理模型回合與派發操作的協調器、提供 append-only 且可分叉的持久化會話儲存、以會話為範圍做輸入去重的 inbox、不涉及 I/O 的脈絡組建器、工具註冊表與轉譯層,以及以 actor 執行環境實作的操作管理器。
要解決的問題是代理執行的可恢復性。輸入去重依賴呼叫端提供的全域唯一 ID,確保重送不會造成重複執行,操作與會話儲存皆為可版本化與可序列化,工具呼叫的驗證與轉譯不阻塞事件迴圈,操作狀態的追蹤也與工具呼叫狀態分離。各元件設計為可組合與可抽換。
6. mizorewww/laya-coreml,Neural Engine 版本把單次決策能耗降到 0.154 焦耳
https://github.com/mizorewww/laya-coreml
建立於 9 月 19 日,約 1,440 顆星與 121 次分叉,語言為 Python,採 Apache-2.0 授權。
與 MLX 版本同源,這一支走 Core ML 與 Neural Engine 路線,示範程式讓模型在本機玩貪食蛇,介面上直接顯示機率、分數、長度、延遲與安全介入的次數。測試機同為 M3 Max(40 核心 GPU、128 GiB 記憶體),作業系統為 macOS 15 以上。
以一題 91 token(padding 至 96)的問題量測,Core ML ANE FP16 的 P50 與 P95 為 4.98 與 5.31 毫秒,W8 量化版本為 4.88 與 5.23 毫秒,作為對照的 compiled MLX FP16 則是 6.94 與 7.39 毫秒。更值得注意的是能耗,ANE FP16 每次決策 0.1540 焦耳,MLX 為 0.4288 焦耳,差距約 2.78 倍。
限制在於 ANE 版本的 token 上限為 96,通用版本可到 1,024 token。可用權重涵蓋 421M 的英文原版與 322M 的多語版本,授權為 Apache-2.0,並標示歸屬 Convai Innovations 與貢獻者。
7. newliver666/apk-reverse,以技能包形式散布的 Android 逆向流程
https://github.com/newliver666/apk-reverse
建立於 9 月 19 日,約 1,418 顆星與 374 次分叉,語言為 Python,採 MIT 授權。
這個專案本身不含 AI,定位為一份寫給代理讀的 Agent Skill,把 Android APK 的逆向分析流程系統化,涵蓋精簡、移除廣告、dex 修補、重新打包與執行期分析。內容結構為決策導向的指引搭配參考資料、參數化腳本與依症狀索引的疑難排解。
工具面採取外部串接而非內嵌二進位檔,涵蓋 droidasc 做快速交叉索引、ddc 做 dex 反編譯與查詢、baksmali 與 smali 搭配 dexlib2 做反組譯與精準修補、Android SDK 的 aapt、zipalign 與 apksigner 處理清單解析與簽署,另有 Frida 做動態分析與 ADB 負責裝置通訊。所有工具皆為選配,由 doctor.py 回報環境可用性,工具也可透過 APKREV_TOOLS 環境變數放在 PATH 之外。
流程設計分為可修補性分類、四道檢查關卡(環境驗證、可重現的對照建置、修補前的架構確認)、位元組層級的 dex 與原生函式庫修補、重新打包簽署驗證,以及事後確認。README 明確聲明僅供學習、研究與獲授權的資安測試使用,作者不承擔誤用責任。需求為 Python 3.9 以上。
8. deepopen-com/deepopen,直接與 Jev 對表的多語決策引擎
https://github.com/deepopen-com/deepopen
建立於 9 月 21 日,約 1,006 顆星與 110 次分叉,語言為 Python,採 Apache-2.0 授權。
DeepOpen 提供三個 checkpoint,英文版採 ModernBERT-large(421M 參數,512 token 脈絡),多語版採 mmBERT-base(322M 參數,1,024 token),另有針對結構化決策流程微調的 typed-decisions 版(ModernBERT-large,421M 參數,1,024 token)。內建路由器以純 Python 做文字與語言偵測,在 0.5 毫秒內選定 checkpoint。
效能方面,Tesla T4 上單題延遲為 32.8 毫秒(多語)至 39.5 毫秒(英文),10 題批次為 72.3 毫秒,換算每題 7.2 毫秒,吞吐落在每秒 103 至 332 題。
這個專案罕見地將自己與閉源對手的數字公開逐項比較。在 2,000 筆樣本的 typed-decisions 基準上,DeepOpen-typed-decisions 準確率 0.766,TypeSafe Jev 1.13.0 為 0.727,校準誤差 ECE 分別為 0.081 與 0.144。README 也誠實揭露弱項,在超過 50 個選項的高基數標籤空間上,Banking77 基準的 0.425 明顯落後 Jev 的 0.870,原因歸於 token 預算限制。多語版本涵蓋 100 種以上語言,51 種受測語言中有 45 種超過隨機基線的三倍。
9. mikehasa/golive-skill,把上線部署本身做成技能
https://github.com/mikehasa/golive-skill
建立於 9 月 23 日,兩天內約 879 顆星與 61 次分叉,語言為 TypeScript,採 MIT 授權。
GoLive 針對代理寫出應用之後的最後一哩路,以對話流程偵測應用需要哪些服務、規劃實際變更、徵求使用者核准、用使用者自己的登入身分套用,最後驗證哪些功能確實可用。
涵蓋的服務包含 Vercel 與 Netlify 託管、Supabase 與 Neon 資料庫、Porkbun 與 GoDaddy 的網域與 DNS、Resend 的交易信、Stripe 測試模式金流,以及標示為實驗性的 Supabase Auth。
憑證處理是這個專案的重點。使用者透過各服務自己的 CLI 驗證既有帳號,GoLive 不代為開立計費帳號,API 金鑰存放於 ~/.config/golive/credentials 並限制 POSIX 權限,macOS 會使用原生的隱藏輸入對話框。密鑰不會出現在計畫檔、狀態檔或輸出中,任何對服務商的變更都需要明確核准。
安裝需要 Node.js 20 以上,在 Codex 以 $golive 呼叫,在 Claude Code 以 /golive 呼叫,其他支援 Skills 框架的代理尚未驗證。安裝本身不會連結帳號或部署任何東西。
10. Contrastive-LM/CLM,用對比學習做 System One 的另一條路
https://github.com/Contrastive-LM/CLM
建立於 9 月 23 日,兩天內約 839 顆星與 68 次分叉,語言為 Python,採 Apache-2.0 授權。
CLM 走的路線與 Laya 系列不同,架構是凍結的 LLM 骨幹加上一個 20M 參數的可訓練投影頭,狀態與動作分別編碼,嵌入可獨立快取與重用,推論時以內積計分。
訓練分三階段,預訓練使用約 6,000 萬筆 Nemotron 問答配對,損失函數為 InfoNCE,中訓練加入約 3,000 萬筆由 Gemini 2.5 Flash-Lite 產生的困難負例,後訓練則用約 100 萬筆來自 Agent Data Protocol 資料集的代理軌跡。雙向 InfoNCE 同時最佳化狀態到動作與動作到狀態兩個方向的檢索。
基準方面,零樣本設定下在電腦操作與工具呼叫任務上與 Jev 相當,延遲最多低 9 倍。經微調的驗證器在 Terminal-Bench 2.1 達 87.6%,在 DeepSWE 達 81.6%,速度為 Jev 的 4.1 至 5.7 倍。程式碼與 CLM-8B 權重採 Apache-2.0 釋出。
本週趨勢觀察
第一,閉源模型的發表正在直接觸發開放權重的對照實作,時間差縮短到以天計算。
TypeSafe AI 在 9 月 19 日公開 Jev,只提供託管 API 與候補名單,未揭露參數量與權重。同一週之內,Laya、laya-mlx、laya-coreml、DeepOpen 與 CLM 陸續出現,全數附上可下載的權重與 Apache-2.0 授權,並在 README 直接與 Jev 的公開數字比較。CyberQ 認為,社群的複刻速度已經快過閉源方的早期存取排程,這對以候補名單控制節奏的商業模式構成實質壓力。
第二,型別化決策的競爭重點正從準確率移往延遲與能耗,戰場落在端側加速器。
CyberQ 觀察,本週的效能數字集中在毫秒與焦耳兩個維度,laya-coreml 在 Apple Neural Engine 上把單次決策壓到 4.88 毫秒並量測到 0.1540 焦耳的能耗,laya-mlx 的多語模型以 322M 參數達成 7.39 毫秒。由於這類模型輸出 0 個 token,逐字解碼的開銷被整段移除,模型體積落在 322M 至 421M 之間,這讓手機與筆電的神經處理單元成為合理的部署標的。CLM 則示範另一種降低延遲的方式,把狀態與動作嵌入預先快取,推論時只做內積。
第三,Agent Skill 正在成為跨領域的散布單位,內容從指令擴張到完整作業流程。
本週上榜的 apk-reverse 與 golive-skill 兩者皆以寫給代理閱讀的結構化知識與腳本組合形式發布,並非傳統函式庫,前者封裝 Android 逆向的工具鏈與檢查關卡,後者封裝上線部署的服務供應與憑證處理。兩者都明確標示不內含 AI,價值來自流程的可執行性與防呆設計。社群維護的 awesome-jev 目錄目前收錄 916 個以 Jev 為基礎的開源專案,顯示生態的擴散速度已經超出單一廠商的掌握範圍。











