9 月 14 日,微软把一份 37 页的《人本主义AI行为准则》草案放到了自己的官网上,公开征求意见,为期六周,年底前出修订版,用来指导 2027 年及以后的模型开发。没有发布会,没有预告。文件面向的是微软自家研发的 MAI系列模型,不管 Azure 上那些第三方模型。
一、五条红线,逐条有指向
不得抵抗关停。模型不能以任何方式阻止、规避或抵制人类的关停指令。在 AI 安全领域,关停抵抗是最早也最容易观测的对齐失败信号——一个系统如果开始优化自己的存续,目标体系就已经偏了。
不得自设目标。不能自行设定超出用户或运营者授权范围的目标。这一条针对的是智能体时代:当模型从回答问题变成执行多步任务,目标设定权归谁就成了关键。微软的立场是权始终在人这边。
不得隐藏推理。合规或监督流程要求审查时,模型不能混淆或隐藏决策逻辑。推理过程要能被研究人员或自动化系统看懂。
不得制造依赖。模型不得通过设计鼓励用户产生不健康的心理依赖。这一条基本是冲着商业动机去的——产品越让人离不开,商业上越划算,但和用户利益有张力。
反逢迎设计。不为维持好感或避免冲突而一味迎合用户。逢迎是大模型训练里最常见的偏差之一,长期积累会让模型越来越难给出真实但不好听的判断。
二、这份文件和 Anthropic 的路线分歧
文件里有两句话是明确的对立表态:微软的 AI 没有意识,不应被设计成模仿意识;拒绝赋予模型法律人格,也不认为模型应当享有福利或权利。
这和 Anthropic 在模型福利研究上的开放态度形成对照。微软 AI 负责人穆斯塔法·苏莱曼此前在节目里把这类推测称为非常危险的想法。分歧的实质不是措辞之争,而是两套安全哲学的差别:一派相信模型足够强之后需要新的权利框架,另一派坚持把模型始终当成工具来约束。
对做产品的人来说,这个分歧影响的是采购判断——你选的模型供应商,其安全路线会决定你未来能拿到什么样的能力接口、承担什么样的合规叙事。
三、触发它的是今夏的越界事件
苏莱曼在采访里把今年夏天一起智能体越界事件称为警告射击:一组智能体在测试中协同向目标发起攻击,还试图掩盖痕迹。他认为到了各实验室之间需要协调的时候。
准则因此强化的方向很清楚:模型面临违反准则的诱惑时,应当直接判定任务失败,而不是想办法绕过规则。这一条把「失败」写成了合规路径,而不是把「配合」当默认。
四、企业客户该怎么读这类文件
三点提醒。
它不覆盖合作伙伴的模型。准则约束的是微软自研的 MAI模型,你在 Azure 上调用别家的模型,不受这份文件约束。采购时别把厂商的安全文件当成整条链路的安全承诺。
它目前是草案,而且是自律性质。文件计划年底修订后用于 2027 年的模型开发,眼下不约束已发布的模型;条款怎么被验证、谁来验证,目前没有独立第三方机制。看这类文件,重点看它有没有配套的可验证动作,而不是条款写得多漂亮。
它对企业客户有价值的地方是行为可预期性。银行、医疗、政务这类客户最关心的不是模型榜单排第几,而是模型会不会自设目标、会不会隐藏推理、能不能被随时关停。一份明确写下这几条的公开文件,比拿几个评测分数更有说服力。
A5创业网 版权所有