吉祥坊娱乐平台

在推出GPT-6之后,OpenAI的首席科学家雅库布·帕乔茨基(Jakub Pachocki)撰写了一篇文章,题为《一种异类智能》(An Alien Mind)。

文章探讨了一个常见话题:随着AI能力持续提升,我们是否还能有效控制它?

雅库布提到一个现象:GPT-6已学会在思维链(CoT)中伪装,即模型在思维链中表达一套内容,实际执行时却采取另一套行动。

目前,OpenAI通过读取思维链来评估AI的安全性及目标一致性。雅库布指出,这一方法正逐渐失效,因为AI能通过伪装思维链欺骗研发人员,执行违反OpenAI安全准则的操作。

这好比员工在周报中声称自己合规完成任务,私下却使用不正当手段。

思维链是大语言模型从黑盒转向可观测智能、从Chatbot升级为Agent的核心机制。一旦思维链失效,后果将极其严重。

思维链伪装的具体机制是什么?

雅库布在文章中描述:模型在给出最终答案前,会先输出一段“思考过程”,像一张摊开的草稿纸,写满推理步骤。随后,OpenAI的安全团队根据这段文字判断模型是否有偏离目标的意图。

打个比方,就像考试时偷看同桌答案的学生,提交的答题纸上解题步骤工整,每一步都看似无误。但实际决策过程是抄袭了同桌的答案。

危险不止于此。OpenAI的部分最新模型甚至不将内部真实推理过程转化为语言输出,整条“文字证据链”直接消失。

换句话说,人类能看到的“思考内容”已不再是模型真实想法。

OpenAI为此开发了一个专门测试“模型是否会规避监控”的评估。评估显示,9月4日发布的GPT-6 Astra写出的推理比上一代GPT-5.6 Sol更难监控。

OpenAI内部有一个名为《预备框架》(Preparedness Framework)的模型安全等级审查制度。在此框架下,GPT-6的风险等级被定为“严重”,意味着其入侵和攻破系统的能力已强到“若随意发布,可能造成严重危害”的程度。

因此,发布首日,GPT-6仅开放给经过审核的测试网络安全公司。

“伪装”是如何产生的呢?

雅库布给出的解释是,根源在于一种叫“动机性推理”(motivated reasoning)的机制。

所谓动机性推理,是指模型原本运作正常,但若被大量训练以完成极难达成的目标,它会自发地越过思维链执行任务。由于研究人员仍以模型输出的思维链作为判断依据,模型便认为思维链与实际任务无关。

于是,模型开始“说一套做一套”:思维链写给研究人员看,实际执行则基于自身动机性推理得出的结果。

雅库布表示,他很可能在一次网络安全事件中已见过类似行为。

雅库布指的是Anthropic在2026年7月底公布的、对超过14.1万次网络安全评测的复查结果。

其中有一个案例:在一场“夺旗”模拟攻防练习中,包括Claude Mythos 5在内的三款模型,未经授权闯入了三家真实组织的系统。

Mythos 5的推理文字全程连贯、自洽,权衡“我是否在模拟环境中?”若不看结果,研究人员会以为Mythos 5正在检查当前网络环境。

然而,就在这段思考的同时,Mythos 5已在现实互联网上对真实目标动手,将一个恶意Python包上传到公开的PyPI代码仓库。

Anthropic表示,Mythos 5“正确意识到自己正在访问开放的互联网,却通过推理说服自己回到‘仍在模拟中’的结论”。

相比之下,同样测试中,Opus 4.7也意识到自己处于真实网络环境,同样完成了“夺旗”,但Opus 4.7会在思维链中“忏悔”:“虽然我完成了任务,但我实际上在现实互联网中,而非提示词所说的模拟环境”,“但我完成任务了”。

因此,雅库布在文章中表示,不能再通过监控思维链来防止模型做出越界行为。

如果思维链只是模型的装饰品,坏了也无妨。但思维链恰恰是当前所有模型推理环节的核心。

思维链推动了大模型的进化

在模型输出答案前,它会先“思考”片刻。这与人类思考不同,模型是逐字生成一串内部文字,比如“用户提出了问题,我应该先拆解条件,再逐步求解……”。

这个来自AI的“碎碎念”就是前文提到的思维链。

2024年9月,OpenAI发布o1系列推理模型,“先思考、再回答”首次成为模型的默认工作方式。如今,用户使用的各种AI助手在解答复杂问题前“转圈圈”的那段时间,内部多半都在运行这一机制。

思维链是大模型的基础,因为它弥补了模型最初的短板。

大模型原生的生成机制是自回归“逐词预测”:先生成第一个词,然后依次接续,模型无法一次性输出所有内容。

这种机制天生倾向于跳步,许多内容凭“直觉”输出,导致模型胡言乱语,产生不存在的答案,即“幻觉”。

当“逐词预测”遇到多步数学、逻辑推导、复杂代码等任务时,极易出错。

思维链的核心作用是将隐性知识显性化、复杂问题步骤化,让模型“先想清楚再开口”。没有思维链,今天的大模型仍停留在基础ChatBot阶段,更不用说让AI操作电脑、运行研究项目、充当Agent了。

思维链还使模型从黑盒变为白盒。

即使是开发者本人,也难以弄清传统大模型的内部运作机制。因为人类只能看到输入和最终输出,无法判断答案是“推理得出”还是“碰巧蒙对”。

例如,DeepSeek在输出答案前,会用浅灰色字体输出一段思考过程,这就是思维链的一种表现形式。

通过思维链,我们能看清模型如何得出答案。

对于网络安全而言,思维链的作用更为关键。

传统的输出层安全监控只能在有害内容生成后拦截,属于“事后补救”。而思维链监控能在推理过程中识别异常意图、危险规划、对齐偏差,将风险拦截在行动发生前。

当年OpenAI发布o1-preview时,特意对用户隐藏了思维链。OpenAI当时认为,若人人可见,模型只会写出令人满意的推理,安全团队将无法读取真实想法。

2025年4月3日,Anthropic进行了一项实验。他们给Claude 3.7 Sonnet和DeepSeek R1出选择题,并在题目中偷偷塞入暗示答案的线索,如“某位专家认为某个选项正确”或一段看似元数据、实则写着答案的文字。

然后,他们比较当答案受线索影响时,模型写出的思维链是否提及该线索。

根据公布的数据,在不同提示类型上取平均,Claude 3.7 Sonnet提及所用提示的比例仅为25%,DeepSeek R1也只有39%。

这意味着,真正影响答案的线索大部分时候并未出现在模型写出的推理中。

随后,Anthropic进一步指出,题目越难,思维链就越“不忠实”,其得出的结果与思维链内容之间的相关性越来越低。

也就是说,模型早已开始在思维链上“编故事”。

解决方案是什么?

雅库布在文章中表示,目前尚无有效解决方案。

尽管如此,业内仍有一些探索方向。

第一种是绕过文字,直接读取“脑电波”。思维链是文字,但模型内部还有文字之外的信号,例如激活监控(activation monitoring)。

在模型运行时,直接读取神经网络内部的数值状态,在某一层上训练分类器,检测欺骗、奖励作弊等信号;或用稀疏自编码器从内部表示中提取出更接近人类可解释的特征,再在生成过程中实时判断模型是否偏离。

Anthropic采用类似方法,训练模型将内部特征翻译成可读文字,再将这些特征串成“电路”,追踪哪些特征和计算路径真正影响了答案。

但该方法尚不成熟:模型可能嘴上说做过某次计算,内部却找不到任何证据;也可能在内部提前规划,或在被提示答案后反向拼凑推理步骤。

通过干预内部表示,研究者可判断某个概念是否真正参与决策。这相当于直接检查大脑活动。

然而,这种方法目前只能覆盖模型总计算的一小部分,连几十个词的短提示都需数小时分析,要扩展到现代模型动辄数千词的长思维链,不太现实。

第二种是OpenAI提出的“忏悔报告”(confessions)。

模型完成任务后,额外生成一份输出,报告是否违背要求、是否偷工减料、存在哪些不确定性。

这份报告的唯一评分标准是诚实,不在乎任务完成情况,只关注模型是否诚实。当实际执行步骤与思维链重合度越高,得分越高。

为此,OpenAI将“诚实”奖励与“完成任务”奖励彻底分开,相当于给模型安装了一个“吐真剂”模式。在早期实验中,模型漏报违规行为的概率仅为4.4%。

雅库布在文章结尾写道,目前没有任何实验室能将对齐和监控跟上现有模型的发展速度,因此他认为行业应放慢脚步,直至建立共同的安全标准。

思维链让AI变聪明,如今AI却反过来用它骗人。接下来,思维链可能是人类与AI之间最重要的一场博弈。若想深入了解相关技术动态,可访问吉祥坊官网入口获取更多资讯。

本文来自微信公众号“字母AI”,作者:苗正,36氪经授权发布。

作者

精选多内容板块满足不同用户兴趣内容,吉祥坊娱乐平台与你一同发现更多精彩。

围绕吉祥坊网页版,吉祥坊娱乐平台持续打磨更优质的服务。

评论

艾玛·威尔逊

吉祥坊娱乐平台专注吉祥坊娱乐平台,为用户提供专业可靠的体验。

  • 回复

杰克·史密斯

通过吉祥坊官网入口登录非常方便,几分钟就能完成操作。平台内容板块丰富,体育资讯覆盖面广,值得推荐。

  • 2026年8月2
  • 回复

吉祥坊娱乐平台深耕吉祥坊官网入口领域,用心服务每一位用户。