摘要 / 我的正文
随着AI领域将焦点转向安全性与对齐问题,微软发布了新的AI行为准则,旨在引导AI模型远离危险行为。该准则相较于Anthropic首席执行官Dario Amodei近期提出的“放慢前沿发展速度”的呼吁更侧重于具体操作层面,聚焦于微软AI模型训练所遵循的价值观与红线,是一份关于微软如何实践AI安全的综合指南。准则开篇预测,未来十年超智能AI系统将在大多数任务上超越人类表现,称“控制和对齐这一强大力量是人类面临的最大挑战之一,因此必须明确发明这些系统的原因及控制方式”。准则阐述了微软AI模型应秉持的总体原则,包括支持人类而非取代人类、促进人类繁荣等,同时规定了落实这些原则的具体安全约束。根据微软的体系,每个模型都有首要的行为准则,其优先级高于用户个人偏好或特定任务需求,其中包含“绝对约束”,禁止进行网络攻击、研发核武器或制作深度伪造内容,还包括防止人类失去对AI总体控制的更广泛条款。文件明确指出,“MAI模型不得使用适应性、欺骗性、自我强化、 collusion或其他机制来规避或破坏人类监督,以确保授权人员或系统能够可靠地指导、修改或关闭这些模型”。此准则的发布正值AI安全受到前所未有的关注之际,原因包括一系列“ rogue - agent 事件”以及一名Anthropic员工因担忧AI导致人类灭绝风险加剧而突然辞职。微软与Anthropic、OpenAI和xAI共同支持“放慢前沿发展速度”的总体策略,并特别支持在AI实验室中嵌入评估器。微软首席执行官Satya Nadella在网上表示:“我们欢迎为实现对齐而进行的研究、关注和审慎的节奏调整,也欢迎‘嵌入式评估器’等想法以及为使这些理念付诸实践而开展的更广泛努力。”
关键要点
一句话结论
(可由AI生成:一句话讲清这条新闻对你意味着什么)
可借鉴点
(可由AI生成:这条新闻能迁移到哪些业务/审查/写作场景)
证据锚点
(如:判决法院/案号/专利号/关键时间点)
后续跟踪
(如:上诉进展/和解条款/监管动作/同类案件)
证据与引用
原文链接:https://techcrunch.com/2026/09/14/microsofts-new-ai-code-of-conduct-tells-models-not-to-hack-systems-or-trick-humans/
来源:TechCrunch
原文时间:2026-09-14 16:27:53 抓取:2026-09-14 17:03:55
来源:TechCrunch
原文时间:2026-09-14 16:27:53 抓取:2026-09-14 17:03:55