主要内容
AI研究人员普遍认为其开发的技术未来可能极具危险性,但如何控制这些难以捉摸的算法仍不明确。多伦多大学研究员Raymond Douglas在新报告《Pacing the Frontier》中警告,减缓AI发展仍是未解难题,“我们甚至不清楚有哪些选择或它们将带来什么后果”。
近期,Anthropic一名研究员离职警告称,AI或在数年内威胁人类安全,引发美国大型AI公司领导人(如Anthropic的Dario Amodei、OpenAI的Sam Altman等)支持减缓或暂停AI发展。这一担忧源于AI公司正利用AI自身构建更强大模型,形成“递归自我改进”(RSI)循环,可能导致AI能力远超人类理解范围。
为应对风险,AI公司已采取行动。Anthropic宣布Claude模型现承担26%的AI研究工作(2026年初为0),并将6%的计算预算用于安全研究。但专家指出,有效控制需外部参与,第三方评估(如“红队测试”)是可行方案之一。
前英国AI安全研究所首席科学家Geoffrey Irving认为,严格检查或可暂停前沿AI发展,而非营利组织Control AI则呼吁引入FBI或NSA参与评估,批评现有“第三方评估”实为内部利益相关方。新研究或能改善模型评估,如外部人士可在不泄露机密的情况下检查模型使用情况。