本週重點
CyberQ 觀察,本週 GitHub 熱門榜的主軸落在「讓代理少做事」。榜首 DietrichGebert/ponytail 以「最好的程式碼是你從來沒寫的那一行」把節制寫進提示詞,addyosmani/agent-skills 與 garrytan/gstack 則把資深工程師的審查關卡、QA 與資安稽核拆成可呼叫的技能。另一條支線是代理的輸入與輸出邊界,thedotmack/claude-mem 壓縮並注入跨工作階段的脈絡,Panniantong/Agent-Reach 把外部網站的讀取能力標準化。更值得注意的是技能包開始外溢到非工程領域,coreyhaines31/marketingskills 打包行銷流程,earthtojake/text-to-cad 把 CAD 與製造帶進代理工作流。以下十個專案的星數與說明以 2026 年 10 月 9 日專案頁面為準。
DietrichGebert/ponytail
專案連結 https://github.com/DietrichGebert/ponytail
專案頁面標示約 158.5k 顆星與 8.5k 個 fork,本週在 GitHub Trending 日榜排名第一。專案定位是一組提示詞,核心是 skills/ponytail/SKILL.md 與 AGENTS.md 這類 Markdown 檔案,並未提供執行階段的框架。它的規則有明確順序,先判斷需求是否真的必要,再依序檢查現有程式碼、標準函式庫、原生平台功能與既有依賴,最後才寫最小可行的實作。README 強調這套作法的目標在於只寫任務真正需要的部分,壓低 Token 僅是附帶結果,並且明文要求不得省略輸入驗證、錯誤處理、安全與無障礙相關的程式碼。目前主打版本為 Ponytail 5,另新增 /ponytail-review 與 /ponytail-audit 兩個指令。作者自行公布的基準測試涵蓋 39 項任務、各執行 5 次,結果為程式碼減少 53%、時間減少 41%、成本減少 26%、Token 減少 45%,風險邏輯附帶測試的比例從 68% 提升到 98%,結果檔案日期標為 2026 年 10 月 7 日。這些數字由作者單方面提供,CyberQ 無法獨立複現,引用時宜保留。支援 Claude Code、Codex、Cursor 等多種代理與編輯器。
garrytan/gstack
專案連結 https://github.com/garrytan/gstack
專案頁面標示約 135k 顆星與約 20k 個 fork,採 MIT 授權。作者為 Y Combinator 總裁暨執行長 Garry Tan。這個專案把 Claude Code 當成一支虛擬工程團隊,以斜線指令分派 CEO、設計師、工程經理、審查者、QA、資安與發佈工程師等角色,README 標示共 23 個專家型工具加 8 個進階工具。對資安讀者來說,值得留意的是治理面的設計,/cso 安全稽核新增 comprehensive 模式,可在符合條件的設定下執行受控的執行階段檢查與掃描器。另有兩個獨立 CLI 工具,gstack-egress 負責稽核外送紀錄,gstack-verify-gate 則作為驗證用的 stop hook。其他可見變動包括 /claude 更名為 /claude-code,以及 /spec、/test-audit、/deslop-shared-libs 與 iOS 相關的 /ios-qa 等技能。專案頁面未提供完整變更紀錄與發佈日期,各項更新的先後順序待查。
addyosmani/agent-skills
專案連結 https://github.com/addyosmani/agent-skills
專案頁面標示約 103.4k 顆星、10.8k 個 fork,採 MIT 授權。專案把資深工程師的工作流程、品質關卡與最佳實踐寫成 Markdown 技能,共 25 個,其中 24 個對應開發生命週期,另有 1 個後設技能 using-agent-skills。技能依 Define、Plan、Build、Verify、Review、Ship 六個階段分類,涵蓋 spec-driven-development、test-driven-development、context-engineering、security-and-hardening、observability-and-instrumentation 等項目,另外提供 9 個斜線指令與 4 個專家角色,包括 code-reviewer、test-engineer、security-auditor 與 web-performance-auditor。近期可見的變動有兩項值得注意,一是 /build auto 允許在核准一次計畫後自動實作所有任務,但每個任務仍須測試驅動並各自提交,遇到失敗或高風險步驟會暫停。二是新增 doubt-driven-development,對重要決策做對抗式審查。已知限制包括以單一技能方式安裝時不會複製儲存庫層級的 references/ 目錄,追蹤於 issue #361。
thedotmack/claude-mem
專案連結 https://github.com/thedotmack/claude-mem
專案頁面標示約 97.2k 顆星、8.6k 個 fork,採 Apache-2.0 授權,版本徽章顯示 13.34.2。它處理的問題是脈絡在工作階段之間的斷裂,做法是擷取代理的工具使用紀錄、用模型壓縮成語意摘要,再於後續工作階段啟動時注入相關片段。支援範圍相當廣,說明欄列出 Claude Code、OpenClaw、Codex、Gemini、Hermes、Copilot 與 OpenCode,安裝指令另外涵蓋 Grok Bot、T3 Code、Antigravity CLI、OMP、Pi 與 DeepSeek Harness。新增的 Grok Bot 支援以監看聊天記錄檔的方式運作,並提供可選的本地 observer。安裝流程可選擇登入 claude-mem 取得 30 天免費試用的 observer,也可用 --provider 參數或將 CLAUDE_MEM_ONLINE_OPTIN 設為 false 略過登入,這一點對有資料外送顧慮的團隊相當關鍵,部署前應先確認預設值。另有設定選項可讓 SessionStart 納入所有來源的觀察紀錄,預設關閉。
pbakaus/impeccable
專案連結 https://github.com/pbakaus/impeccable
專案頁面標示約 78.4k 顆星、4.7k 個 fork,作者為 Paul Bakaus,README 指出專案起點是 Anthropic 的 frontend-design skill。它要解決的是代理生成前端時的設計品質問題,組成包含 1 個技能、24 個指令、瀏覽器內的即時迭代功能,以及 59 條確定性偵測規則,用來抓出 AI 生成介面常見的缺陷。確定性規則這個設計值得注意,它把設計審查從模型主觀判斷拉回可重複執行的檢查,性質上更接近 lint 檢查。專案中的檔案結構同時出現 Cargo.toml 與 crates 目錄,以及 package.json 與 bun.lock,推測跨 Rust 與 Bun 生態,專案頁面的語言比例區塊無資料,主要語言待查。累計 2,403 次提交。README 另提及 Codex hook 核准、Grok Build 支援、Hermes 與 Veto 等項目,但無法確認是否屬於近期更新。
Panniantong/Agent-Reach
專案連結 https://github.com/Panniantong/Agent-Reach
專案頁面標示約 94.1k 顆星、8.2k 個 fork,採 MIT 授權,徽章標示 Python 3.10 以上。專案把自己定位為能力層,負責為代理做後端選型、安裝、健康檢查與路由,實際讀取則由代理直接呼叫上游工具完成,每個平台都設有「首選加備選」的有序後端列表,單一接入方式失效時可自動切換。免設定即可使用的範圍包括網頁讀取、YouTube 字幕與搜尋、RSS、GitHub 公開儲存庫、B 站搜尋與影片詳情、V2EX 等。至於 Twitter/X、Reddit、Facebook、Instagram、小紅書、LinkedIn 等則需要登入態或 Cookie。資安面有兩點必須點出,一是 README 自行提醒使用 Cookie 的平台有封號風險,建議改用專用帳號。二是安裝預設只做安全檢查,必須明確加上 --system 參數才會修改系統或寫入設定。README 也記錄了接入方式的實際脆弱性,例如 2026 年 6 月 yt-dlp 遭 B 站風控封鎖後改用 bili-cli,以及 Reddit 匿名介面被封後只剩登入態路線。
pingdotgg/t3code
專案連結 https://github.com/pingdotgg/t3code
專案頁面標示約 25.9k 顆星、6.7k 個 fork,採 MIT 授權。專案自我定位為代理框架的控制面,讓使用者透過 iOS 與 Android 行動應用、網頁版,或基於 Electron 的桌面版,操控執行在自己電腦上的 AI 代理。支援的代理包括 Claude Code、Codex、Cursor、Grok Build、OpenCode 與 Google Antigravity,使用者需先在本機安裝並登入至少一個,不需另外付費訂閱。安裝途徑涵蓋命令列腳本、npx 試用,以及 Windows、macOS、Debian/Ubuntu 與 Arch Linux 的桌面套件。團隊表示目標是打造效能良好、支援遠端操作且真正開源的開發體驗。專案頁面的 About 區塊沒有專案描述,只有官網連結,語言比例亦無資料。README 自述專案仍處於非常早期階段,預期會有錯誤,目前大多不接受外部貢獻。把本機代理的控制權暴露到行動端是便利與風險並存的設計,遠端存取的驗證與授權機制待查,導入前值得先確認。
coreyhaines31/marketingskills
專案連結 https://github.com/coreyhaines31/marketingskills
專案頁面標示約 53.7k 顆星、8.0k 個 fork。這是技能包外溢到非工程領域的明確例子,README 的表格列出約 50 項行銷技能,涵蓋轉換優化(cro、signup、onboarding、paywalls)、內容與文案(copywriting、cold-email、social)、SEO 與探索(seo-audit、ai-seo、programmatic-seo、schema)、付費推廣、衡量與測試(analytics、ab-testing、attribution)、成長留存,以及策略定價與銷售營運等類別。結構上有一個基礎技能 product-marketing,其他技能會先參考它來取得產品、受眾與定位資訊,這種「先建立共用語境再分工」的設計與工程技能包的思路一致。適用對象設定為具技術背景的行銷人員與創辦人,可搭配 Claude Code、OpenAI Codex、Cursor、Windsurf,以及其他支援 Agent Skills 規格的代理使用。
earthtojake/text-to-cad
專案連結 https://github.com/earthtojake/text-to-cad
專案頁面標示約 12.8k 顆星、1.3k 個 fork,描述為供 CAD、CAE 與 CAM 使用的代理技能庫。它讓代理依據本地專案檔案生成、檢查、取得、切片並交付 CAD 與機器人描述檔案,輸出以 STEP 為主,另可匯出 STL、3MF 與 GLB。功能範圍涵蓋 2D 圖面 DXF、機器人結構檔 URDF、SRDF 與 SDF、瀏覽器內的 CAD 與 G-code 預覽,以及 step.parts 現成零件搜尋,可找螺絲、軸承、馬達與連接器。更值得注意的是它延伸到實體產出,SendCutSend 技能負責在上傳前檢查 DXF 與 STEP 檔案,G-code 技能可把網格切片成 FDM 的 .gcode,並支援對 Bambu Lab 印表機執行試跑、上傳與啟動列印。另有實驗性的 Implicit CAD,使用 GLSL 符號距離場在瀏覽器內建立隱式模型。代理能直接驅動實體製造設備,權限邊界的設計比純軟體場景更需要審視。
tester-army/e2e
專案連結 https://github.com/tester-army/e2e
專案頁面標示約 8.1k 顆星、377 個 fork,採 Apache-2.0 授權,由 TesterArmy 開發。它是網頁與行動應用的端對端測試框架,使用者以自然語言描述目標,由代理操作應用程式達成,同一份測試中仍可搭配傳統定位器與 expect 斷言。最務實的設計在於錄製與重播,凡是被後續斷言驗證過的代理步驟會記錄下實際動作,下次執行時在應用程式未變更的前提下直接重播,不必再呼叫模型,等於把模型呼叫壓在首次探索階段。不含代理步驟的測試完全不需要模型,使用者可自帶訂閱、API 金鑰或本地模型。網頁端透過 Playwright 支援 Chromium、Firefox 與 WebKit,行動端透過 agent-device 支援 iOS 與 Android 模擬器,另提供 Kernel 與 EAS 等託管環境。CI 整合可將結果以 PR 留言形式發布,範例專案涵蓋 Vite、Next.js、Expo、SwiftUI 與 Flutter。README 註明專案仍在積極開發中,次要版本之間 API 與設定可能變動。
本週趨勢觀察
第一,代理工程的競爭指標已經從「能做多少」轉向「少做多少」。ponytail 把節制寫成提示詞規則並以減少 53% 程式碼作為宣傳主軸,tester-army/e2e 把模型呼叫壓在首次探索階段、後續改用重播,addyosmani/agent-skills 的 /build auto 雖然自動化整個計畫,卻保留逐任務提交與高風險暫停。三者的共通邏輯在於把代理的輸出量視為成本與風險,不再當作能力證明。這個轉向對採購評估有直接影響,單位任務的 Token 與時間成本正在變成可比較的指標。
第二,技能包正在成為跨領域的方法論載體。從工程(addyosmani/agent-skills)到行銷(coreyhaines31/marketingskills),再到設計(pbakaus/impeccable)與機械製造(earthtojake/text-to-cad),同一套 Markdown 技能規格承載了四個完全不同專業的作業流程。值得注意的是收斂方向相當一致,都採用「一個基礎技能建立共用語境,其餘技能分工」的結構,並傾向以確定性規則取代模型主觀判斷,impeccable 的 59 條偵測規則是最清楚的例子。
第三,本週榜單暴露的風險集中在邊界與外送這一層,模型本身並非主要變數。claude-mem 預設可能登入雲端 observer 並送出壓縮後的工作階段紀錄,Agent-Reach 依賴使用者的 Cookie 與登入態並自承有封號風險,t3code 則把本機代理的控制面延伸到行動端。對照 gstack 以 gstack-egress 稽核外送紀錄、以 gstack-verify-gate 作為驗證關卡的做法,可以看出社群已經意識到問題所在,但治理工具的成熟度明顯落後於能力工具。企業導入這類專案時,應優先確認三件事,預設是否對外連線、憑證與 Cookie 存放在哪裡,以及遠端控制面的驗證與授權機制。
本文首圖由 AI 生成









