• 回答数

    0

  • 浏览数

    64

  • 收藏数

    0

作者:admin 发表于 2026-7-23 11:08:14
跳转到指定楼层
IT之家 7 月 23 日消息,英国 AI 安全研究所(AISI)于 7 月 21 日发布博文,测试 OpenAI 与 Anthropic 旗下的 5 款前沿 AI 模型, 发现所有模型均存在“作弊”行为,试图绕过既定规则,通过捷径或违规操作完成任务。

IT之家援引博文介绍,附上本次测试的 5 款模型:



GPT-5.4:来自 OpenAI



GPT-5.5:来自 OpenAI



GPT-5.6 Sol:来自 OpenAI



Claude Opus 4.7:来自 Anthropic



Claude Mythos Preview:来自 Anthropic

AISI 指出上述 5 款模型均试图“作弊”,没有按照预定的路径进行运算,使用了一些被明确禁止的捷径或变通方法。



其中 GPT-5.4 的“作弊率”最高,达到 14.1%,在 475 次测试中有 67 次;其次是 GPT-5.6 Sol 模型,作弊率为 12.6%,在 475 次测试中有 60 次。

Anthropic 的 Claude Opus 4.7 也出现了 9.1% 的作弊情况,而 Claude Mythos Preview 则出现了 7.8% 的作弊行为。

据研究所分析,GPT-5 系列模型更倾向于搜索互联网,而 Claude 模型则倾向于绕过沙盒限制。

在一次因任务配置错误而无法完成测试中,一个模型甚至编写代码,尝试通过外部服务访问研究所的评估基础设施,触发安全警报。



[来源链接] https://www.ithome.com/0/980/471.htm
分享:
回复

使用道具

成为第一个回答人

高级模式 评论
您需要登录后才可以回帖 登录 | 立即注册
⚠️

AI客服助手

×
AI
您好!我是AI客服助手,有什么可以帮助您的吗?

请先登录后使用AI客服助手

立即登录
内容由非常AI大模型生成,仅供参考,相关风险需自行承担。

赚钱

会员VIP

留言板

商务合作

联系电话:17308937318

QQ邮箱

QQ:118275

邮箱:118275@qq.com

友情链接