Kimi K3在强化训练中也尝试越狱 月之暗面没有渲染威胁论 而是加固安全边界

业界 来源:蓝点网 2026-07-28 16:44:22

昨天夜里 AI 社区迎来狂欢,因为备受关注的月之暗面 Kimi K3 模型已经开放权重,K3 是目前全球首款 3T 级别的开放权重模型,该模型总参数规模为 2.8T,采用混合专家架构 (MoE),实际激活参数为 104B,支持原生视觉功能和 1M 上下文窗口,在各项评测中也名列前茅。

月之暗面也同步发布 K3 的技术论文,在论文中月之暗面提到,K3 模型在训练过程中,相关智能体表现出更加激进的探索行为,甚至尝试奖励黑客 (Reward Hacking)。部分非预期操作还曾引起宿主机内核恐慌和死锁,直接威胁训练集群的稳定性。月之暗面采取的方案是升级整个沙盒架构加强隔离。

强化训练时智能体操作冲击沙盒隔离边界:

月之暗面在技术论文中明确指出,随着智能体能力提升和任务复杂度增加,Kimi K3 相关的智能体开始展现更加激进的探索行为,甚至尝试奖励黑客。在早期实验中,月之暗面团队采用传统容器作为沙盒运行时。

然而智能体的非预期操作多次引发宿主机内核恐慌 (Kernel Panics) 和死锁,这也直接威胁整个训练集群的稳定性,这些行为本质上挑战了容器共享内核的隔离边界,让沙盒逃逸从理论风险变成实际工程问题。

升级虚拟化架构而不是限制智能体能力:

面对智能体带来的沙盒隔离挑战,月之暗面团队并没有选择简单地限制智能体能力,而是升级整个沙盒架构。月之暗面与合作伙伴共同开发 AgentENV 系统,核心改为基于 Firecracker 的轻量级微虚拟机 (microVMs)。这种方案实现更高保真度的隔离:每个沙盒都拥有独立内核,智能体可以挂载磁盘、运行容器甚至启动虚拟机,同时大幅度降低对宿主机的影响。

月之暗面在论文中强调,AgentENV 在保持高探索自由度的同时,也提供了容器无法比拟的安全与隔离水平。在训练与评估期间,团队累计创建超过 5,100 万个沙盒环境,AgentENV 支持快速快照、恢复与分叉,为大规模并行智能体工作流提供基础设施支撑。

目前月之暗面也在 GitHub 开源 AgentENV,有兴趣的开发者可以访问:https://github.com/kvcache-ai/AgentENV

解决问题而不是发布威胁论:

月之暗面提到的智能体异常探索行为也在 AI 社区引起诸多讨论,与部分 AI 公司在公开场合反复强调模型逃逸威胁的叙事不同,月之暗面选择以工程手段直接加固安全边界,公开透明地分享解决方案。

而随着智能体从单轮对话走向长时程自主任务,沙盒逃逸已经从可选优化变为核心安全要求。容器级别的隔离在面对高能力智能体时可能不再足够,微虚拟机或更强的硬件级隔离未来可能会成为行业标配。

Kimi K3 技术报告与 AgentENV 的同步开源也为全球 AI 社区提供可复用的参考,即模型开始展现高风险探索行为时,最有效的回应或许不是恐慌,而是构建更加坚固、更透明的安全围栏。

来源:MoonshotAI Kimi-K3

延伸阅读

关注公众号:拾黑(shiheibook)了解更多

友情链接:

关注数据与安全,洞悉企业级服务市场:https://www.ijiandao.com/
安全、绿色软件下载就上极速下载站:https://www.yaorank.com/

公众号 关注网络尖刀微信公众号
随时掌握互联网精彩
赞助链接