内容审核智能体

10 分钟读完

Y16
实战手册 · 领域实战手册

内容审核智能体:政策是判例法,而它没有一条写在政策文档里。

公开的社区准则大概只占审核员实际适用规则的百分之五;其余是十年间围绕边界案例累积起来、却从没被写下来的判例。把准则塞进提示词,你得到的智能体会在容易的那百分之九十五上既自信又正确——而那部分本来就用不着模型——却恰恰在人类要上报的那些案子上自信地答错。请把审核建成"在已决案例上的检索",而不是"从政策文本出发的分类",并让基础发生率而不是准确率分数来告诉你还需要多少审核员。

STEP 1

你的政策文档,是一套判例法的摘要。

每一个成熟的审核运营团队,跑的都是一份远比公开政策庞大的内部执行指引:范例、豁免、地区例外、两年前那起事件之后的那份备忘,以及一条悄悄确立判例的上报队列。"禁止血腥暴力"这条规则,对一张新闻照片、一幅医学插图、一段游戏录像、一份历史档案、一部战争纪录片,什么也没解决。这些区分活在决定里,不在文本里。

  • 容易的案子早就自动化了。哈希拦住已知素材,分类器拦住显而易见的,垃圾信息启发式拦住量。按构造,落到人手上的正是那几层解决不了的残渣——所以一个在随机抽样上被度量的智能体,是在一个它在生产中永远见不到的分布上被打分。
  • 难的案子取决于内容本身并不包含的上下文。谁发的、发给谁、回复的是什么、有怎样的历史、在哪个国家、用哪种语言、处在新闻周期的哪个时刻。同一句话,随说话人不同,可以是骚扰,也可以是自我称谓的夺回。
  • 一致性才是产品。用户和监管机构首先要求的不是你正确,而是你对同类案件一视同仁。一个准确率 92%、却对两条一模一样的帖子给出不同结论的智能体,比一个更迟钝但一致的更糟,因为被截图传播的正是不一致。
  • 因此目标不是"给这条内容分类",而是"适用管辖这条内容的判例"。那是一个附带决定的检索问题;把它框成分类,正是本页其余部分所要纠正的那个错误。
STEP 2

把它建成在已决案例上的检索。

你早已拥有却从不动用的那份资产,是决定历史:数以百万计带着裁定、政策条目、审核员、处置结果、往往还带着申诉结果的条目。那份语料就是执行指引,而且是唯一完整且当下的形式。

  • 作决定之前先检索相邻的旧决定。对一条待审内容,拉出最相似的、此前已决的条目及其裁定与理由。智能体的活儿于是变成推理"这条判例是否适用"——这是模型远比开放式判断更擅长的任务,而且它的输出人在几秒内就能核对。
  • 把引用设为强制。每一次裁定都要点名政策条款以及它所遵循的先例。这样一来,不同意的审核员就能对着具体的东西争论,而一次申诉也能用一条理由而不是一个类别来答复。
  • 按时间给语料加权,因为政策会变。上一次政策修订之前的裁定是个陷阱,不是先例。给政策做版本管理,给每条决定打上当时生效的版本标签,并让检索偏向当前这一代。
  • 当先例彼此冲突时,那是一个信号,不是一个待打破的平局。两条几乎相同的内容拿到相反的裁定,意味着政策在那里确实含混。把它们路由给人,更重要的是路由给政策团队——一个能把你自家执行中的不自洽暴露出来的智能体,交付的价值高于一个把它糊过去的。
  • 用混合检索,不要纯向量。侮辱性词汇、品牌名、产品术语与暗语都是精确匹配问题,而语义相似度会把它们稀释掉。见混合检索与重排序
STEP 3

决定审核员编制的是基础发生率,不是准确率分数。

审核正是那个"听起来极好的模型指标产出无法使用的系统"的领域,因为违规稀少而干净的样本浩如烟海。在你向任何人承诺"审核成本下降"之前,先把这道算术做一遍:

# 10M items/day, 0.2% actually violating
items      = 10_000_000
violations = items * 0.002                    # 20,000

# A model at 95% recall and 99.5% specificity — strong numbers:
true_pos  = 0.95 * violations                 # 19,000
false_pos = 0.005 * (items - violations)     # 49,900

# Precision    = 19,000 / 68,900  =  27.6%
# Review queue = 68,900 items/day, 72% of which are fine
  • 决定队列长度的是精确率,不是召回率。在这个基础发生率下,半个百分点的特异度比五个百分点的召回率更值钱,而这两者通常被朝相反方向权衡——因为召回率是那个听起来像"安全"的数字。
  • 按置信度与危害分档,并把不对称性说明白。只在危害严重且判定几乎确定时自动下架;对绝大多数干净内容自动放行;把中间那一段按预期危害排序后交给人。中间那条带子才是这套系统本身。
  • 给队列排序,比替队列做决定收益更大。把最糟的那条先摆到审核员面前,对现实危害的削减胜过把长尾里的简单判断自动化,而且几乎不带风险。先交付这个。
  • 在这个量级上成本是真金白银。一天一千万次模型调用是一笔严肃的账单;请廉价路由,把昂贵的那条路留给含混的那一档。见模型路由与级联智能体成本控制
STEP 4

申诉是唯一免费的标签,也是望向误判的唯一窗口。

每一套审核系统的结构性盲区在于:下架对除被下架者之外的所有人都是不可见的。你会很快得知自己漏掉了本该拿下的东西——有人举报、记者写稿、监管来问。而你可能永远不会得知自己删掉了一万条正当发言,因为受影响的用户多半选择离开而不是争辩。

  • 把每一次被推翻的申诉立刻当作一个带标签的案例。它是基准真值,由你自己的审核员产出,每天到货,且不花钱。一个没有被申诉流水线喂养的审核智能体,正在丢掉它最好的数据来源。
  • 按政策领域与智能体版本跟踪推翻率。某一类目里推翻率的上升,是智能体漂移最早也最清晰的信号,而它比任何外部投诉都要早几周。
  • 把对自动放行内容的抽样复审当作常设成本。这是唯一能度量"没人会来报告的那个方向"上的错误的机制。它永远是智能体看起来好用时第一个被砍掉的东西,而砍掉它,正是一次无声回归得以跑满一个季度的原因。
  • 申诉处理不能是同一个智能体。由作出决定的那个模型来复核申诉不是复核,而是同一次计算多走了几步,并且对自己的答案抱有强烈先验。
STEP 5

说明理由与人工复核是法律产物,不是产品功能。

审核是少数几个"输出具有法定形状"的智能体领域之一。按欧盟《数字服务法》,限制内容的服务提供者须向用户出具一份说明理由的告知,解释依据与可用的救济途径,并把这些告知提交至一个公开的透明度数据库;同时须运行一套内部投诉处理系统,其决定由具备资质的人员监督作出,且不得仅依靠自动化手段。请据此设计,并核对适用于你自身司法辖区与规模的义务。

  • 理由必须由决定推导而来,而不是在决定之后生成。让模型去解释它已经作出的裁定,得到的是一段说得通的重构;而对一个错误决定的说得通的重构,是一句写得漂亮的假话。理由应当来自被检索到的先例与被引用的条款,并在作出决定的那一刻被记录下来。机制见结构化拒绝与理由链
  • 把记录做成不可篡改且可归属的。内容、政策版本、模型版本、被检索到的先例、裁定,以及若有人工批准则是哪一位。这是法律意义上的审计轨迹,不是调试日志,而且它会被一个带着敌意的人读。
  • 投诉路径上的那个人是一条设计约束,不是一行成本。请把申诉队列设计成由具备资质的人员作决定、智能体负责把案子准备好而不是把它了结——并确保"具备资质"能在吞吐指标面前站得住。
  • 为每个政策领域指名负责人。智能体不吸收责任;执行决定仍然是平台的。见问责与角色监管版图

这个领域还有一条特有的性质:被审核的内容,出自那些明知有模型在读它的人之手。嵌在帖子里、图片里、文件名里或个人简介里的指令,是直接对着你的智能体去的,而回报——保住不被删,或者让对手被删——立竿见影。抵达模型的一切都是被界定过的不可信数据,而任何一段用户撰写的文本,都不该有能力独自放行一条内容或触发一次下架。通用机制见提示词注入 101;这个领域特有的部分在于,这里的对手可以公开地、大规模地反复重试。

STEP 6

用漂移与不一致来评估,因为准确率是一个移动的靶子。

本季度搭起来的评测集,在这里比本章任何其他领域衰减得都快:对手在数小时内适应,暗语每周换代,而政策本身也会随事件被修订。一份静态基准量的是"你对着上个月的互联网做得有多好"。

  • 按难度分层,衡量与审核员的一致率。总体一致率被简单案例主导,永远好看。请单独报告上报那一档的成绩,因为那才是智能体实际被请去帮忙的那个人群。
  • 直接度量自洽性。喂进近乎重复的条目,断言裁定相同;把同一条内容喂两遍,断言结果相同。自我不一致是一种完全不需要基准真值就能检出的缺陷,而它恰恰是用户会注意到的那一种。
  • 保留一片会不断长大的对抗性切片。注入尝试、混淆过的侮辱性词、同形异码字符、把已知违规内容写得人畜无害的措辞,以及上个月那套规避手法。每起事件都添一个用例;这套套件是一个只进不退的棘轮。
  • 把裁定构成的漂移当作无标签警报来看。健康系统里各类目下架量的占比是稳定的。某个类目的下架率一夜之间动了百分之十,要么是你平台上真发生了什么,要么是你的智能体回归了——而你想在一小时内知道是哪一个,不是等到下次评审。
  • 不要让智能体与评判者出自同一个模型家族。与智能体共享盲区的 LLM 评判会热情地为这些盲区背书。在利害如此不对称的地方,作数的评判者是一份人工抽样。

先从给人工队列排序、以及把先例检索出来供审核员阅读做起——两者都交付了大部分可得的时间节省,都不可能删掉一条正当发言,而且都会产出你在任何自主决策站得住脚之前所需要的引用数据。然后只在危害严重先例毫不含混的地方做自动化。衡量一个审核智能体的不是它判了多少条,而是两条一模一样的帖子会不会拿到同一个答案,以及你能不能把理由写下来。

相关:安全运营智能体是同样面对对抗性输入的邻居领域,人在回路讲检查点该放在哪里,而改编一份实战手册是这一篇背后的方法。