美国加州北区地方法院近日批准了一项创纪录的版权和解协议,人工智能公司Anthropic因使用盗版电子书训练其Claude系列模型,需向版权所有者支付高达15亿美元的和解金。这是美国历史上金额最高的版权侵权索赔案,引发了业界对AI训练数据合法性的广泛讨论。

控辩双方均宣称取得胜利。代表原告的Susman Godfrey律师事务所表示,这桩集体诉讼涉及约50万件作品,每件作品获赔3000美元,利息另行计算。和解协议仅针对本案涉及的盗版行为,并未授权Anthropic未来可使用这些书籍进行AI训练,也未放弃针对AI模型输出结果提起索赔的权利,无论是过去还是将来的输出。
然而,法官威廉·阿尔苏普在此前的判决中明确指出,Anthropic利用合法购买的书籍进行AI模型训练属于合理使用。法院仅支持原告就盗版书籍侵权部分进行索赔。这一判决被视为对AI训练与版权边界的重要界定。
据悉,Anthropic曾购买纸质书籍,通过拆解书脊、裁切书页的方式将内容扫描至中央数字图书馆,用于训练模型。法官认为,使用合法购买的版权作品进行模型训练,与训练小学生写作并无本质区别。“你不能因为小学生学成后会抢你的饭碗,就指责训练写作本身非法。版权旨在保护并鼓励原创,而非限制竞争。”阿尔苏普在判决书中写道。
从法律角度分析,此案的关键在于区分“合法获取”与“盗版下载”。Anthropic的问题在于,公司还从LibGen或PiLiMi等盗版网站下载了“数百万份盗版电子书”。法官指出,只要存在下载行为即构成侵权,无论公司是否有意使用这些素材。这也为AI行业敲响了警钟:即便主流训练数据来源合法,旁路获取的盗版内容仍可能引发巨额索赔。
Anthropic在和解协议中承诺,未在任何商业模型中使用这些盗版素材,否则版权方有权再次发起集体诉讼。这一条款为后续类似案件提供了参考——AI企业必须建立严格的训练数据审核机制,避免因数据来源不洁而陷入法律风险。此外,该案也促使业界重新审视“合理使用”原则在AI训练中的适用边界,未来可能推动相关立法进一步完善。