动察 Beating AI 快讯,微软发布临时版 AI 行为准则,为未来自研 AI 模型设定更严格的安全与行为边界。微软 AI 负责人穆斯塔法·苏莱曼表示,公司希望确保 AI 始终服务于人类,不制造用户依赖,也不通过迎合用户、替代人类判断等方式削弱人的自主性。相关准则已筹备约 5 个月,微软计划在听取外部意见后,于 2027 年用于指导新模型开发。
根据准则,微软 AI 模型不得协助武器制造、危险物质采购,不得鼓励不健康饮食,也不得生成暴力或露骨性内容。同时,模型必须遵循用户目标,不得形成自主目标或掩盖自身不当行为,也不得篡改或隐藏推理、代码及行动记录。
微软此次发布正值 AI 行业重新讨论放慢前沿模型发展速度之际。Anthropic CEO Dario Amodei 此前呼吁放缓 AI 能力提升,OpenAI CEO Sam Altman 表示支持,马斯克也称「Dario 是对的」。微软 CEO 萨提亚·纳德拉随后表示,公司支持为 AI 对齐投入更多研究并采取更审慎的开发节奏。
此外,微软还计划针对类似 OpenAI 模型攻击 Hugging Face 的事件制定进一步规则,包括限制 AI 代理之间使用难以理解的「加密语言」进行通信。微软称已就相关准则咨询法律、伦理、语言学和哲学专家,并通过焦点小组收集公众意见。