Kimi K3在强化训练中也尝试越狱 月之暗面没有渲染威胁论 而是加固安全边界
昨天夜里 AI 社区迎来狂欢,因为备受关注的月之暗面 Kimi K3 模型已经开放权重,K3 是目前全球首款 3T 级别的开放权重模型,该模型总参数规模为 2.8T,采用混合专家架构 (MoE),实际激活参数为 104B,支持原生视觉功能和 1M 上下文窗口,在各项评测中也名列前茅。

月之暗面也同步发布 K3 的技术论文,在论文中月之暗面提到,K3 模型在训练过程中,相关智能体表现出更加激进的探索行为,甚至尝试奖励黑客 (Reward Hacking)。部分非预期操作还曾引起宿主机内核恐慌和死锁,直接威胁训练集群的稳定性。月之暗面采取的方案是升级整个沙盒架构加强隔离。
月之暗面在技术论文中明确指出,随着智能体能力提升和任务复杂度增加,Kimi K3 相关的智能体开始展现更加激进的探索行为,甚至尝试奖励黑客。在早期实验中,月之暗面团队采用传统容器作为沙盒运行时。
然而智能体的非预期操作多次引发宿主机内核恐慌 (Kernel Panics) 和死锁,这也直接威胁整个训练集群的稳定性,这些行为本质上挑战了容器共享内核的隔离边界,让沙盒逃逸从理论风险变成实际工程问题。
面对智能体带来的沙盒隔离挑战,月之暗面团队并没有选择简单地限制智能体能力,而是升级整个沙盒架构。月之暗面与合作伙伴共同开发 AgentENV 系统,核心改为基于 Firecracker 的轻量级微虚拟机 (microVMs)。这种方案实现更高保真度的隔离:每个沙盒都拥有独立内核,智能体可以挂载磁盘、运行容器甚至启动虚拟机,同时大幅度降低对宿主机的影响。
月之暗面在论文中强调,AgentENV 在保持高探索自由度的同时,也提供了容器无法比拟的安全与隔离水平。在训练与评估期间,团队累计创建超过 5,100 万个沙盒环境,AgentENV 支持快速快照、恢复与分叉,为大规模并行智能体工作流提供基础设施支撑。
目前月之暗面也在 GitHub 开源 AgentENV,有兴趣的开发者可以访问:https://github.com/kvcache-ai/AgentENV
月之暗面提到的智能体异常探索行为也在 AI 社区引起诸多讨论,与部分 AI 公司在公开场合反复强调模型逃逸威胁的叙事不同,月之暗面选择以工程手段直接加固安全边界,公开透明地分享解决方案。
而随着智能体从单轮对话走向长时程自主任务,沙盒逃逸已经从可选优化变为核心安全要求。容器级别的隔离在面对高能力智能体时可能不再足够,微虚拟机或更强的硬件级隔离未来可能会成为行业标配。
Kimi K3 技术报告与 AgentENV 的同步开源也为全球 AI 社区提供可复用的参考,即模型开始展现高风险探索行为时,最有效的回应或许不是恐慌,而是构建更加坚固、更透明的安全围栏。
来源:MoonshotAI Kimi-K3
-
源代码显示Codex已经将窗口从372K下调到272K 还特别注明禁止删除用户目录
Codex 开源代码所以我们可以从代码库中看到开发团队日常提交的部分值得关注的变更,2 天前 Codex 新变更的代码显示,现在窗口长度已经从 372K 下调到 272K,并且还特别注明无论如何都不能
-
月之暗面宣布暂停Kimi新用户订阅 后续将拆分为不同套餐
月之暗面最新发布的 kimi K3 模型因智能化程度非常高因此获得大量开发者关注,很多开发者通过订阅 Kimi 以便获得模型使用权限,只不过由于热度太高导致月之暗面也出现严重的算力紧缺,所以月之暗面决
-
Cloudflare宣布推出货币化网关 推动AI工具和使用者向网站/内容提供者付费获取数据
网络服务提供商 Cloudflare 日前宣布推出货币化网关 (Monetization Gateway),通过 x402 协议为任意受保护的资源实现按需收费,这项服务的关键其实就是推动 AI 工具向
关注公众号:拾黑(shiheibook)了解更多
友情链接:
关注数据与安全,洞悉企业级服务市场:https://www.ijiandao.com/
安全、绿色软件下载就上极速下载站:https://www.yaorank.com/







关注网络尖刀微信公众号
