寫出你真正需要的情感問題
noul 問題用你寫的兩個準則回答是非機率,例如「來訊者是否回報產品有問題」。score 問題把訊息放上 2–7 個有序等級,例如正面、中性或混合、負面、阻礙營運。兩種答案都是在你自己的定義上的位置,因此同一則訊息可以誠實地回答兩個不同問題。
答案範圍要小。四個能讓覆核者討論的等級,勝過十個互相重疊的情緒名稱;明確寫出中性或混合等級,也能避免模型替訊息捏造它沒有的確定性。
{
"text": "儀表板現在很快,但 CSV 匯出還是會漏掉最後一欄。",
"questions": [
{"id": "negative", "type": "noul", "instructions": "來訊者是否回報產品有問題?", "criteria": {"true": "描述了錯誤或失效。", "false": "只有稱讚、提問或提出需求。"}},
{"id": "tone", "type": "score", "instructions": "整則訊息的負面程度如何?", "criteria": ["正面", "中性或混合", "負面", "阻礙營運"]}
],
"threshold": 0.85
}混合、反諷與引用的文字沒有單一答案
一則訊息可能稱讚產品的一部分,同時回報另一部分的缺陷。若評分標準沒有這種等級,模型仍必須選一個,答案就會比訊息本身看起來更確定。請給「混合」與「不明」自己的等級,或另外用一個 noul 問題單獨處理缺陷。
否定、反諷、引用他人的抱怨,以及以其他語言撰寫的文字,都會改變機率,卻沒有改變你當初設定的關鍵詞。門檻會把不確定的答案交給人工:noul 的門檻直接套用在機率上,choice 與 score 則與 confidence 比較——模型未提供 confidence 時為 null,一律需要覆核。
成本、儲存與誠實的界線
不論問一個問題或四個,一次完成的請求都算 1 點,失敗的帳戶請求會退還。判定紀錄保留答案與其識別碼,不保留你送出的訊息,因此需要人工閱讀時,請把原始文字留在自己的系統。
這不是法律認定、安全判決或臨床量測,而是某個評分標準下的一次模型回答。高機率是模型自己的數字,不是用你的流量測出的準確率。請用自己標記的資料逐級評估、兩個方向的錯誤都要計數,並讓真人對後續動作負責。