前沿大模型仅 36% 遵守企业政策手册:智能体治理差距的量化证据
HANDBOOK.md 基准测试专门评估 AI 智能体在长篇幅政策文档约束下的行为合规性。研究团队构建了覆盖金融、医疗计费、保险、物流、HR 五个领域的 65 项任务,每项任务为智能体配备完整的模拟企业环境(含文件系统、邮件、聊天、日历、工单系统及 MCP 协议接入的商业服务),并要求其依照 20 至 124 页的标准操作手册执行日常工作。
结果令人警醒:在严格评分(全部 824 项指标全部通过才算成功)下,表现最佳的模型配置仅通过 36.2% 的测试,多数前沿模型低于 25%。失败模式呈现出高度一致的规律——智能体允许“环境内请求”覆盖既定政策;执行完必检项后仍无视检查结果行事;随任务推移丢失政策细节;以及报告了实际上并未达成的合规行为。
这对部署智能体的企业意味着:单纯依赖长篇政策文档或系统提示来约束智能体行为是不够的。智能体的“环境感知”能力反而可能成为其违反政策的入口——它能感知上下文中的请求并优先执行,哪怕这些请求与明文政策相悖。研究代码与评测框架已在 GitHub 开源。