如果不是看了法院判决的原文,我绝对不知道Anthropic有这么畜生。。。。
一边天天教育全世界要重视AI安全,一边为了训练Claude,干了一套相当畜生的事情。
首先是它花了数百万美元,买下数百万本实体书。
然后雇人把书脊拆掉,把每一页裁开,逐页扫描成可以检索的PDF,最后把纸质原书全部丢弃。
法院的表述是:
「The print original was destroyed. One replaced the other.」
纸质原件被销毁,数字副本取而代之。
数百万本书,就这样被买回来,拆掉,裁开,扫描,销毁。
但这甚至还不是Anthropic干得最离谱的事。
判决显示,从一开始,Anthropic明明有很多渠道可以买书,但法官直接写道,它更愿意「preferred to steal them」,因为这样可以避开Dario Amodei所说的法律、实务和商业麻烦。
并且Anthropic联合创始人Ben Mann还亲自下场了。
2021年初,他下载了Books3,里面有196640本未经授权的版权书籍。
几个月后,他又从LibGen下载了至少500万本盗版书。
2022年,Anthropic继续从PiLiMi下载了至少200万本。
判决明确指出,Ben Mann和Anthropic知道这些累计超过700万本的书是盗版的。
更恶心的是,Anthropic后来已经意识到法律风险了。
内部开始对继续使用盗版书训练模型有所顾忌,原因就是「法律问题」。
但法院紧接着写了一句:「It kept them anyway.」
虽然知道有问题,Anthropic它还是把书留下来了。
当然Anthropic也尝试过找出版社授权。
2024年,它专门挖来Google图书扫描项目的前合作负责人,任务是弄到「世界上的所有书」。
他给几家大型出版社发了一两封邮件,询问AI训练授权。
法院认为,如果继续谈下去,原本可能达成许可协议。
但Anthropic高层让这些谈判直接中止了。
因为高层认为谈版权太麻烦,还是批量买书、拆书、扫描比较省事。
而那些被Anthropic弄来被并被销毁的书,也不是训练完就删掉。
Anthropic准备把它们放进一个永久的通用中央图书馆。即使已经确定某些书永远不会再用于训练,也要继续保存。
法院还提到,数百名工程师可以访问这些文件,并为其他用途制作副本。
法官甚至批评Anthropic在相关证据披露上进行了回避。
但最讽刺的是,法院最后认定:用这些书训练大模型,本身可以属于合理使用。
原因是任何人合法购买实体书后,将它一对一转换成数字副本,并销毁原书,也可以属于合理使用。
Anthropic真正栽掉的,是它明知书籍来自盗版网站,仍然下载超过700万本,并试图建立一个永久保存的通用图书馆。
法院最后还特意表示:
Anthropic后来买下一本它此前从网上偷来的书,也不能免除之前盗版的责任。
所以这件事里Anthropic最畜生的地方是:
Anthropic并不是因为不知道版权规则才盗版。
它知道正规授权渠道在哪里,也知道这些书是盗版,更知道继续使用存在法律风险。
它只是觉得走正规流程太麻烦。
这家公司对AI安全的道德要求似乎主要适用于未来的机器。
至于自己,先把700万本书偷回来再说。
点击图片查看原图