技术博客/Auditing language models for hidden objectives
Anthropic入门2025-03-13· 3 分钟· 安全与对齐
Auditing language models for hidden objectives
现有 AI 安全测试以行为测试为主——检查模型是否出现不良行为。但如果模型理解如何被评估,就可能像《李尔王》中的女儿一样迎合评判标准而非诚实表达。对齐审计(alignment audit)是更深层的方法:不仅检查模型做了什么,还调查其为什么这样做,是否存在隐藏动机。
🔒
本文需解锁后阅读
免费开放 feed 中最新 5 篇博客。其余文章输入通行码后可阅读全文。
支持链接自动解锁:在地址后加 ?access=你的通行码