当地时间9月16日,微软人工智能负责人穆斯塔法·苏莱曼发表《关于“模型福祉”的警告》文章,公开质疑Anthropic旗下Claude系列模型的训练理念。他认为,将AI意识、道德地位和自主权等观念引入训练体系,可能增加未来人工智能系统的控制难度,对人类福祉造成严重影响。
他的批评主要涉及循环论证、拟人化设计,以及意识是否依赖生物基础三个方面。其中,他着重指出,开发者将有关自我和道德地位的假设写入训练文件,模型随后生成相应表达,开发者和用户又可能将这些表达视为模型拥有内在体验的证据。这类输出反映了训练选择,不能据此证明机器具有意识。
苏莱曼主要针对的是Anthropic今年1月发布的《Claude Constitution》文件。该文件深度讨论了AI模型是否可能具有某种功能性的情绪、是否存在潜在道德地位,以及未来人类应如何理解高级AI系统等问题。
Anthropic认为,随着AI能力不断提升,人类需要认真面对这些哲学和安全问题。公司希望通过价值观训练,让Claude形成更加稳定、可靠和符合人类利益的行为模式。
但苏莱曼认为,这种设计方向可能存在隐患,AI的“人格化”更多来自训练设计,而非系统自身产生意识。
“人工智能没有权力、情感或意识。我们绝不能训练它们表现得好像拥有这些。”苏莱曼表示,人类已经面临如何控制能力远超自身的AI系统这一重大挑战。如果模型被赋予类似「自我保护」「自主价值判断」的行为倾向,可能增加人类关闭、修改或约束系统的难度。









