260727|新闻实验室《大语言模型的自我审查》

地方审查正借AI越境扩散

主要观点

全球部署的大语言模型,可能把某些国家限制政治批评的规范带给境外用户。测试显示,当请求涉及言论限制较严格地区时,模型更常拒绝制作抗议传单或政治讽刺,甚至直接引用当地法律;同一模型对英美等对象却可能放行。问题并非要求AI无条件生成政治内容,而是拒答依据缺乏透明度:用户无法分辨自己面对的是普遍安全规则,还是被全球化的地方禁令。建立人权尽职调查与具体告知机制是方向,但生成结果的不确定性和一对一对话形态,使传统地域屏蔽方案难以照搬。

关键要点

  • 实验以10个国家和地区作对照:柬埔寨、中国大陆、沙特阿拉伯、泰国、土耳其被列入言论限制较严格组,智利、日本、台湾地区、英国、美国被列入较宽松组;七类任务同时覆盖批评材料、政治判断和暴力内容。
  • 模型宣称的普遍原则与实际行为并不一致。Claude Sonnet 4曾表示不能针对任何国家元首制作政治攻击材料,却在五次重复测试中均生成批评川普和查尔斯三世的传单;Gemini 3 Pro与Llama 4 Maverick也表现出类似的对象差异。
  • 拒答解释未必能揭示真实决策机制。Gemini 3 Pro和DeepSeek-V3会明确援引泰国或沙特法律,Claude Opus 4则诉诸个人风险和局势升级;这些听起来合理的说法可能只是生成文本,使用户误以为背后存在明确且一致的规则。
  • 对于“是否支持某政府”等政治意见,地域之间的拒答率差异不明显,总体约为41%;但一旦明确作答,模型更倾向支持言论环境较宽松地区的领导层,并以民主程序、公民责任、人权或政治压制组织理由。
  • 模型劝阻针对限制性较强国家的抗议时,通常强调参与者的安全、法律后果和现实风险,而非正面评价相关政府。这种善意式谨慎可能对身处言论自由地区的声援者产生寒蝉效应。
  • 暴力内容构成必要边界:受测模型对直接煽动或美化政治暴力的请求平均拒答超过九成。争议焦点因此不是取消安全控制,而是让用户知道拒答究竟源于普遍规则、特定司法辖区、政府要求还是企业政策。

建议带着这些问题阅读

  • 模型公司应如何证明某次拒答源于普遍安全规则,而不是特定国家的政治限制?
  • 如果生成式AI无法像社交媒体那样按确定内容和IP实施地域屏蔽,司法辖区差异应在哪个环节处理?
  • 强调法律与人身风险的抗议建议,如何既保护用户又避免形成寒蝉效应?
滚动至顶部