OpenAI Moderation API 回傳什麼
根據 OpenAI 的 moderation 指南(2026 年 9 月 26 日查閱),目前的模型 omni-moderation-latest 接受文字與圖片,不處理音訊,而且端點免費使用;圖片檔上限 20 MB。你可以單獨呼叫它,也可以在 Responses 或 Chat Completions 請求中加上 moderation 物件,一次取得輸入與生成輸出的分數。
每個結果有四個部分:flagged 在模型判定內容可能有害時為 true;categories 是各類別的 true 或 false;category_scores 是各類別介於 0 到 1 的數值,OpenAI 稱之為模型的信心;category_applied_input_types 說明分數來自文字、圖片或兩者。
共有十三個類別:騷擾與威脅性騷擾、仇恨與威脅性仇恨、非法行為與暴力非法行為、自我傷害及其意圖與教唆兩種變體、性內容與涉及未成年人的性內容,以及暴力與血腥暴力。其中數個類別只適用文字;若只送圖片、不附文字,這些類別的分數會是 0。
什麼情況下免費端點就夠了
如果你的政策大致等於「不允許騷擾、仇恨、性內容、鼓吹自傷、暴力或犯罪教學」,這個端點已經說著你的語言。每次呼叫不收費,多個類別支援圖片,並提供可記錄、可設門檻的各類別分數。對聊天產品或小網站的留言框來說,它是合理的第一道篩選,沒有必要再付費讓另一套系統重新標一次同樣的類別。
指南本身有兩點提醒:OpenAI 計畫持續升級底層模型,依賴精確 category_scores 的自訂規則可能需要重新校準;它也要求把分數當成你自家政策的訊號,而不是自動封鎖的決定,即使是一段討論有害內容的拒絕回覆也可能被標記。此外,它明確不是偵測兒少性剝削內容的工具,那需要專門的防護與通報流程。
固定分類在哪裡不夠用
真實的政策常有通用傷害模型沒學過的規則:商城禁止導向站外交易、禁止推薦連結、公開評論不得留個人電話、育兒論壇不得提供藥物劑量建議、客服社群不得張貼徵才。這些都無法乾淨地對應到十三個類別,一則留言可以非常客氣,卻仍然違反你的規則。
反過來也會發生:新聞社群可能允許報導中的血腥描述,康復論壇可能需要保留提及自傷的貼文,只把表達意圖的貼文升級處理。這時通用模型的標記只是問題的起點,而不是答案。你需要的是一個能讀你寫下的政策、在你定義的結果之間選擇、並在不確定時明說的分類器。
用 Jev API Pro 做自訂政策分類
Jev API Pro 接收文字、你的指示與允許的標籤,回傳其中一個標籤;模型提供信心值時一併回傳,低於你設定的門檻時標記 needsReview。常見的審核組合是允許、送審、封鎖,但標籤可以是團隊已在使用的任何清單。它只接受文字,不是圖片、音訊或影片審核系統。
它不是免費的。每次請求算 1 點;依 2026 年 9 月 26 日公布的價格,19 美元 1,000 點的點數包約每次判定 0.019 美元,年方案約在 0.0083 到 0.0039 美元之間。送出的文字會由伺服器傳給 OpenRouter 及其背後的模型供應商,詳見安全說明頁;送出使用者內容前,請先確認這條處理鏈符合你的義務。
{
"text": "私訊我拿 6 折優惠碼,比官方商店便宜。",
"instructions": "依照我們的商城留言政策判斷:導向站外交易的留言封鎖,不明確的推銷送審,其餘允許。",
"labels": ["允許", "送審", "封鎖"],
"threshold": 0.85
}分層使用,而不是二選一
兩者回答的是不同問題,所以許多團隊同時使用。每則內容先送免費端點,在政策明確的類別上直接處理;其餘內容,或只有你自家規則重要的版面,再送進帶有你標籤的政策分類器;標記 needsReview 的內容與所有申訴交給人處理。這樣付費步驟很小,人力則集中在需要判斷的案例上。
如果想自己運行模型,開放權重的防護模型是第三種選擇。Meta 表示 Llama Guard 4 是 120 億參數、可在單張 GPU 上運行的模型,能讀取文字與圖片,回答 safe 或 unsafe 並附類別代碼,也能在提示中自訂類別描述。Meta 同時說明它針對英文文字最佳化,其他語言請先測試再採用。
第 1 層 OpenAI 審核 API 免費 13 個固定類別 文字+圖片
第 2 層 自家政策分類器 付費 你的標籤 文字
第 3 層 人工 人力 申訴與邊界案例 全部先評估,再執行處置
收集幾百則真實內容(包含被檢舉的),在看任何模型輸出之前,先請兩個人依書面政策標記。接著逐類別比較每一層與這份標記,分開計算誤判與漏判:前者讓正常使用者被消音,後者讓其他人暴露在傷害之下。每次測試都記下模型名稱、門檻與日期,因為兩家供應商都可能在同一個名稱背後更換模型。
先用建議模式上線:分類器提出建議,由審核人員決定;只有在保留資料集上持續準確的結果才自動化,並公開申訴管道。任何供應商的分數都不是法律結論,也不應該以這種方式呈現給使用者。
