USE-CASES

OpenAI Moderation API 與自訂政策分類

OpenAI Moderation API 免費、容易接入,擅長一件事:依一份固定的傷害類別清單,為文字與圖片評分。但多數社群與電商平台的政策,還包含許多根本不屬於傷害類別的規則。本頁說明這個端點回傳什麼、它的分類在哪裡不夠用,以及如何在上面疊加你自己的政策標籤,而不把分數當成決定。

客戶訊息經過你的標籤規則,取得型別化分類,再進入具有覆核路徑的工作佇列。
客戶訊息經過你的標籤規則,取得型別化分類,再進入具有覆核路徑的工作佇列。

OpenAI Moderation API 回傳什麼

根據 OpenAI 的 moderation 指南(2026 年 9 月 26 日查閱),目前的模型 omni-moderation-latest 接受文字與圖片,不處理音訊,而且端點免費使用;圖片檔上限 20 MB。你可以單獨呼叫它,也可以在 Responses 或 Chat Completions 請求中加上 moderation 物件,一次取得輸入與生成輸出的分數。

每個結果有四個部分:flagged 在模型判定內容可能有害時為 true;categories 是各類別的 true 或 false;category_scores 是各類別介於 0 到 1 的數值,OpenAI 稱之為模型的信心;category_applied_input_types 說明分數來自文字、圖片或兩者。

共有十三個類別:騷擾與威脅性騷擾、仇恨與威脅性仇恨、非法行為與暴力非法行為、自我傷害及其意圖與教唆兩種變體、性內容與涉及未成年人的性內容,以及暴力與血腥暴力。其中數個類別只適用文字;若只送圖片、不附文字,這些類別的分數會是 0。

OpenAI moderation 指南

什麼情況下免費端點就夠了

如果你的政策大致等於「不允許騷擾、仇恨、性內容、鼓吹自傷、暴力或犯罪教學」,這個端點已經說著你的語言。每次呼叫不收費,多個類別支援圖片,並提供可記錄、可設門檻的各類別分數。對聊天產品或小網站的留言框來說,它是合理的第一道篩選,沒有必要再付費讓另一套系統重新標一次同樣的類別。

指南本身有兩點提醒:OpenAI 計畫持續升級底層模型,依賴精確 category_scores 的自訂規則可能需要重新校準;它也要求把分數當成你自家政策的訊號,而不是自動封鎖的決定,即使是一段討論有害內容的拒絕回覆也可能被標記。此外,它明確不是偵測兒少性剝削內容的工具,那需要專門的防護與通報流程。

固定分類在哪裡不夠用

真實的政策常有通用傷害模型沒學過的規則:商城禁止導向站外交易、禁止推薦連結、公開評論不得留個人電話、育兒論壇不得提供藥物劑量建議、客服社群不得張貼徵才。這些都無法乾淨地對應到十三個類別,一則留言可以非常客氣,卻仍然違反你的規則。

反過來也會發生:新聞社群可能允許報導中的血腥描述,康復論壇可能需要保留提及自傷的貼文,只把表達意圖的貼文升級處理。這時通用模型的標記只是問題的起點,而不是答案。你需要的是一個能讀你寫下的政策、在你定義的結果之間選擇、並在不確定時明說的分類器。

用 Jev API Pro 做自訂政策分類

Jev API Pro 接收文字、你的指示與允許的標籤,回傳其中一個標籤;模型提供信心值時一併回傳,低於你設定的門檻時標記 needsReview。常見的審核組合是允許、送審、封鎖,但標籤可以是團隊已在使用的任何清單。它只接受文字,不是圖片、音訊或影片審核系統。

它不是免費的。每次請求算 1 點;依 2026 年 9 月 26 日公布的價格,19 美元 1,000 點的點數包約每次判定 0.019 美元,年方案約在 0.0083 到 0.0039 美元之間。送出的文字會由伺服器傳給 OpenRouter 及其背後的模型供應商,詳見安全說明頁;送出使用者內容前,請先確認這條處理鏈符合你的義務。

{
  "text": "私訊我拿 6 折優惠碼,比官方商店便宜。",
  "instructions": "依照我們的商城留言政策判斷:導向站外交易的留言封鎖,不明確的推銷送審,其餘允許。",
  "labels": ["允許", "送審", "封鎖"],
  "threshold": 0.85
}

送出的文字去了哪裡 · 方案與價格

分層使用,而不是二選一

兩者回答的是不同問題,所以許多團隊同時使用。每則內容先送免費端點,在政策明確的類別上直接處理;其餘內容,或只有你自家規則重要的版面,再送進帶有你標籤的政策分類器;標記 needsReview 的內容與所有申訴交給人處理。這樣付費步驟很小,人力則集中在需要判斷的案例上。

如果想自己運行模型,開放權重的防護模型是第三種選擇。Meta 表示 Llama Guard 4 是 120 億參數、可在單張 GPU 上運行的模型,能讀取文字與圖片,回答 safe 或 unsafe 並附類別代碼,也能在提示中自訂類別描述。Meta 同時說明它針對英文文字最佳化,其他語言請先測試再採用。

第 1 層  OpenAI 審核 API   免費   13 個固定類別   文字+圖片
第 2 層  自家政策分類器     付費   你的標籤         文字
第 3 層  人工               人力   申訴與邊界案例   全部

Llama Guard 4 模型頁 · 人工覆核流程

先評估,再執行處置

收集幾百則真實內容(包含被檢舉的),在看任何模型輸出之前,先請兩個人依書面政策標記。接著逐類別比較每一層與這份標記,分開計算誤判與漏判:前者讓正常使用者被消音,後者讓其他人暴露在傷害之下。每次測試都記下模型名稱、門檻與日期,因為兩家供應商都可能在同一個名稱背後更換模型。

先用建議模式上線:分類器提出建議,由審核人員決定;只有在保留資料集上持續準確的結果才自動化,並公開申訴管道。任何供應商的分數都不是法律結論,也不應該以這種方式呈現給使用者。

上線前先評估分類 · LLM 評審:可稽核的型別化規則

試做一次判定 ↗

繼續工作流程

指南

看得懂規則的 LLM 評審

在這裡,評審不是一段評語,而是一到四個型別化問題——標籤選擇、是非機率,或評分標準上的位置——針對單筆資料作答,讓討論聚焦在規則,而不是措辭。

閱讀指南 ↗
指南

零樣本分類:原理與何時可以信任

零樣本分類(zero-shot classification)讓模型把文字分到它從未針對你的任務訓練過的標籤。你用一般文字描述類別、送出文字,就會得到一個標籤。本文說明它的原理、容易出錯的地方,以及接上正式流程前該怎麼測試。

閱讀指南 ↗
詢問方案與用量

查找產品解答

回答來自已發布的產品指南。如有帳戶相關問題,請聯絡客服。

聯絡我們
每日獎勵

每天免費領取 2 點

每個 UTC 日可免費領取 2 點,領取七天共 14 點。無需購買,點數永不過期。

    每日 00:00 UTC 重置,不要求連續簽到。

    試做一次判定 →

    在您的工作區中進行下一個決策。

    每天 1 次匿名試用 · 註冊送 20 點數 · 試用免綁卡

    登入 ↗

    告訴我們你的需求

    請說明要分類的工作流程、預期用量與所需結果。我們將透過 email 回覆。

    10–2,000 個字元。切勿包含密碼、API 金鑰或付款資料。