![]()
本文来自微信公众号: 扯氮集 ,作者:魏武挥二世
这份超级长的安全报告,掀起了很大的浪花——和以前它的报告所引起的关注讨论,不是一个量级的。简中有很多讨论,海外社媒也热火朝天。我所关注的几家重磅外媒,都是浓墨重彩地“头版头条”级别。但在阅读这份报告之前,我觉得有很多背景信息需要事先掌握或者关注一下。
谁说的,其实比说什么更重要。了解“什么”之前,“谁”必须先行了解。
a社,即Anthropic,其核心创始人是一对因为对OpenAI不满所以出走创业的兄妹。哥哥达里奥(Dario Amodei)和妹妹丹妮拉(Daniela)。哥哥的头衔是CEO,妹妹的职位是总裁兼董事会主席。两人的分工大致是:达里奥是a社的思想领袖、技术路线制定者和公众意见领袖,妹妹则为组织内部建设者和经营中枢。
达里奥有一个核心世界观:AI将迅速走向超级智能,因此必须控制其发展。这套世界观也成为a社的核心世界观。著名科技媒体the information在8月头上有一篇题为《达里奥如何传播anthropic的宗教,并搅动整个硅谷》的文章,引用了一位a社重要投资人的原话”他与其说是CEO,不如说是个宗教领袖”。他的安全团队被前同事形容成一个“祭祀阶层”。达里奥的“神棍”人设,几乎是这家科技媒体一手奠定的。因为这个媒体以前还刊发过一篇题为“Anthropic教团/邪教”的长篇文章以及一些阴阳怪气达里奥的短文或其他报道中的夹带。纵观the information的报道,大致上对a社是比较正面的,但对达里奥的人格、意识形态、以及导致的公司文化和权力运作,有着极其明显的嘲讽性叙事。
但the information并不是只嘲讽达里奥,o社(OpenAI)的奥特曼一样没放过。在该媒体上,奥特曼的人设大致是一个“大忽悠”,以及宫斗爱好者。而且,对于o社这家公司的友好度,显然不如对a社公司——后者该媒体基本是肯定和尊重的。
达里奥的极端使命驱动、a社文化明显比其他大模型公司更意识形态化、不少员工/前员工/投资人感受到宗教或教团色彩,不是the information一家这么认为,连线、纽约客都有类似报道。这三点几乎是一个行业共识。至于是不是一个宗教领袖,有一定争议性(神棍是我给的一个形容)。关于达里奥的AI风险判断,也没有被视为纯粹胡说八道。
OA两家是风头最盛的模型双子座,它们的商业模式也极其类似:卖接口。所以在美国,两家都是出了名的鹰派公司,因为其它大模型尤其是开源模型,事实层面上是他们商业模式的竞争者。至于微软谷歌亚马逊脸书这些old money,是鸽派。因为他们的商业模式中,有很重的算力售卖这部分。其他模型包括开源模型,都是这些old money的客户。当然,英伟达的立场偏好尤甚。这其实都是所谓“经济基础决定上层建筑”。
只不过OA的做法不大一样。o社喜欢打小报告,也就是搞政治游说,不大公开说这个事。符合奥特曼宫斗爱好者的人设。a社喜欢隔三岔五公开发表长篇文章,大喊大叫,符合达里奥要做思想领袖、公众意见领袖的神棍人设。
除了了解“谁在说什么”的谁,还需要留意到谁在什么时候说。时间点同样重要。这份报告的时机嵌在了一个美国政府的行动序列里:报告成为了政府行动的“证据弹药”。另外,a社ipo在即,这份报告也有很强的为ipo摇旗呐喊的味道:我们最强的模型基本扛住了所有攻击行为,我们已成为国家级战略资产。
这篇报告154页,主要陈述25年12月到26年8月七个领域中的高风险行为。a社“发现并打断”了这些行为。请注意,它承认行为达到或部分达到目的,所以只是“发现并打断”而不是“阻挡”。但a社表示,主要发生在该公司目前并非顶级的模型上。Fable和Mythos上只有一起非法蒸馏案例(它甚至指名道姓了一家模型公司因为无法得手便转移了方向),这被该报告视为“更强防护确实有效”的证据,我们的顶级模型不仅强,而且强的可怕,固若金汤。
第一个领域,黑客/网络攻击行为。其实这是本报告篇幅最大的一章,结论是两个趋势:高级攻击无需高级攻击者,ai在攻击行为中越来越ai。报告甚至用了vibe hacking这个词(你应该听说过vibe coding,基本上属于文科生也可以生产代码了)。事实上,ai安全议题里,这两个趋势是本报告最核心的东西,而不是后面那一堆。且a社的结论也比较清楚:面对这两个趋势,闭源大法好。
其二,舆论操纵,但这些行为大多没有怎么触达真实人群,便被打断。
接下来,监控行为、利用ai开发常规武器、以及利用ai研究生物学但到了滥用级别。
第六个领域,诈骗。就是你可能在网上看到过的一个案例(我估计是简中传播最广的一个案例)。交友app,75%的ai负责和用户“谈恋爱”,25%的真人负责向用户保证“我不是ai”。这个其实不是杀猪盘,因为并不需要用户大额转账。有点类似崩老头:用户需要氪金购买额度以维持持续聊天。
第七个领域,就是所谓非法蒸馏,或者叫工业级蒸馏。但老实讲,这个议题不新鲜,a社也不是第一次叫唤,都已经快成了“月经贴”。但这次掀起很大的浪花在于,并非非法蒸馏——如果a社还是叫唤这个不会引起如此之大的注意和讨论——而是数据泄露。但其实很诡异的地方是,a社自己恰恰是获得数据的终点。
总的说来,这份报告描绘了ai攻防战。防守方不断在抬高进攻方成本,但反过来进攻方也在搞出新招数来抬高防守方的成本。而且因为第11点中提及的两个趋势,对防守方的要求变得越来越高。言下之意就是仅仅模型很强是远远不够的。
a社用不同的案例力求证明一件事:开源模型不可靠。比如,在防范生物滥用章节里,它提出要搞可信用户计划,这是为封闭准入制进行背书;比如多次提到因为模型在我们手里,所以我们能发现并阻断。安全=中央托管+可见性,是a社整个报告中试图力证的重要公式。
大致如此,以上。
——首发扯氮集——


