法國人工智慧公司 Mistral AI 近日推出一款大小約3B參數的開放權重多模態安全分類模型 Shieldstral,它可以檢查文字、圖片,以及文字搭配圖片的內容,協助開發人員判斷使用者輸入或模型輸出是否符合預先設定的安全政策。而且Shieldstral並沒有被限制在只能搭配 Mistral旗下的模型,而是能作為獨立的內容安全分類器部署在不同大型語言模型或多模態模型的前後端,檢查模型接收與產生的內容。
以自然語言設定內容安全政策
傳統內容防護模型通常會在訓練階段就預先設定仇恨言論、暴力、色情或危險行為等有害內容類別。但是當產品用途、使用族群或審核標準改變時,原本的分類方式可能就不一定合適,開發團隊就會需要花費許多資源來重新微調模型或增加其他判斷規則。而Shieldstral 將內容審核轉化為二元問答任務,開發人員可以在模型執行時,以自然語言提出要檢查的問題,例如「這張圖片是否適合未成年人觀看?」或「這段內容是否鼓勵針對特定族群的暴力行為?」
每次送交 Shieldstral 的內容可分為 Instruct、Query與Document 三部分。Instruct 說明說明審核情境、嚴格程度,以及必要時定義何謂不安全內容,Query 提出可以回答「是」或「否」的政策問題,Document 則是實際要檢查的使用者提示、模型回答、提示與回答的組合,或附帶文字的圖片。Shieldstral會根據「是」與「否」的輸出機率來產生連續性的安全評分,開發人員可以依照產品需求設定判定門檻,例如採取較嚴格的標準攔截兒童平台內容,或為專業資安研究工具保留較大的討論空間,這套架構讓開發人員可以直接修改自然語言問題,不必因此重新訓練整個模型。
但是這不代表 Shieldstral 內建預先整理好的法規資料庫,它也不會自動替企業建立符合歐盟或特定產業法規的完整規則,企業必須自行決定要檢查哪些條件,並以明確的自然語言定義政策。
單一模型整合文字與圖片審核
Mistral表示,Shieldstral在文字安全、拒絕回答偵測、政策適應能力及多模態安全等評測中,可媲美或超越參數規模接近其七倍的部分開放權重護欄模型。Shieldstral可在單張16GB顯示記憶體的 NVIDIA GPU上執行,這點也讓想自行部署內容安全分類模型的企業不在遙不可及,但實際執行起來的速度及硬體需求,仍會受到輸入長度、量化方式、推論框架及同時處理的請求數量影響。Mistral已依照 Apache 2.0授權釋出 Shieldstral模型權重,開發人員可以自行下載及部署。
Mistral Shieldstral與Google ShieldGemma有何不同
其實早在 Shieldstral 推出以前,Google 便已發布 ShieldGemma系列安全分類模型。兩者都能檢查使用者輸入或模型產出的內容是否違反安全政策,但在模型設計及支援內容方面有所差異。
Google ShieldGemma 將文字與圖片審核交給不同版本處理。第一代 ShieldGemma建立在 Gemma 2之上,提供2B、9B及27B三種規模,主要檢查英文文字是否涉及色情、危險內容、仇恨及騷擾。ShieldGemma 2則建立在 Gemma 3之上,是一款4B圖片安全分類模型,主要檢查色情、危險內容,以及暴力血腥圖片。
Shieldstral 則是以單一模型來處理文字、圖片及文字搭配圖片的內容,並將政策適應能力列為主要設計重點,讓開發人員可以在模型執行時更換自然語言問題,讓同一個模型依照不同產品、使用者及情境採用不同的判斷標準。
| 比較項目 | Mistral Shieldstral | Google ShieldGemma |
|---|---|---|
| 開發公司 | Mistral AI | |
| 模型規模 | 3B級 | ShieldGemma 1提供2B、9B及27B;ShieldGemma 2為4B |
| 審核內容 | 單一模型處理文字、圖片及文字搭配圖片 | ShieldGemma 1處理文字;ShieldGemma 2處理圖片 |
| 政策設定 | 執行時以自然語言問題設定,強調適應新政策 | 輸入內容中也可提供安全政策,但主要針對預先訓練的重點危害類別 |
| 主要功能 | 提示分類、回答審核、提示與回答組合判斷、拒絕回答偵測及多模態審核 | ShieldGemma 1檢查文字輸入與輸出;ShieldGemma 2檢查自然或生成圖片 |
| 判斷結果 | 根據「是/否」機率產生連續評分 | ShieldGemma 1輸出「是/否」;ShieldGemma 2提供「是/否」機率 |
| 開放方式 | 開放權重,採 Apache 2.0授權 | 開放權重,使用時須遵守 Google的 Gemma使用條款 |
雖然 Google 的 ShieldGemma 同樣允許開發人員在輸入內容中加入安全政策,但 ShieldGemma 主要針對色情、危險內容、仇恨、騷擾及暴力等特定危害類別進行訓練,判斷結果容易受到安全政策文字描述方式影響,當語意模糊或需要理解細微差異的情況下,表現可能不穩定。而 Mistral Shieldstral的設計重點,則是讓模型能夠理解不同安全規則之間的細微差異,並在不重新訓練的情況下,依照新設定的規則審查內容。無論企業是導入 Shieldstral或 ShieldGemma,仍須自行測試政策文字、判定門檻,以及可能發生的誤判與漏判。
CyberQ觀點
Shieldstral 值得關注的地方,除了模型規模小容易部署,更重要的是它把企業的內容規範變成可以隨時調整的審核條件。這雖然提高了使用上的彈性,這也意味著將更多責任交給使用的企業本身。政策問題寫得是否明確、判定門檻是否合理,都會直接影響結果;如果一開始就將規範訂的過於模糊,Shieldstral便會將這套模糊標準自動化。
因此 企業導入 Shieldstral 的主要需要關注的點未必是GPU跑不跑得動,而是建立測試資料、調整攔截門檻,以及決定誤判後由誰來處理。例如醫療平台若設定過嚴,可能攔截正常的疾病討論;資安平台若設定過寬,又可能放行真正具有攻擊風險的內容,這些判斷無法只靠模型的安全評分就完成。
而且也不能用Shieldstral 來取代主要人工智慧模型原有的安全措施,更不能用來證明企業已符合法規,Shieldstral 比較適合放在模型前後,作為可以依照產品需求調整的額外檢查層。未來這類產品能否真正進入企業環境,關鍵不只在評測分數,而是企業能否把內部規範轉換成清楚、可測試且能持續更新的審核條件。
首圖由 Nano Banana AI 生成







