在与《纽约时报》 (The New York Times) 等媒体巨头及书籍作者的版权拉锯战中,微软 (Microsoft) 近期提交了关键的法律文件,试图从技术细节上瓦解对方的指控。
争议的核心在于,AI 模型在训练过程中是否未经授权地“窃取”了版权内容,以及在输出结果中是否通过直接复制原文而损害了原作者的利益。对此,微软采取了防御性的数据论证策略。公司在文件中强调,其 AI 助手 Copilot 极少在输出中完整复制新闻文章或书籍的句子,更不用说出现能直接替代原内容的实质性片段。
为了支撑这一论点,微软在诉讼的证据披露阶段提供了高达 820 万条 Copilot 的输出样本。微软试图向法院证明,AI 的生成逻辑是基于模式的学习而非简单的文本存储,因此用户几乎不可能通过 Copilot 直接获取《纽约时报》的完整付费文章。
这场法律战背后,反映了大模型公司在数据合规化方面的集体困境。长期以来,OpenAI 等公司依赖互联网上的海量公开数据进行训练,将其定义为“合理使用” (Fair Use)。然而,随着 AI 产品商业化程度的提高,媒体巨头开始意识到其版权资产被用作商业竞争对手的底层燃料,因此发起反击。
对于全球市场而言,这不仅是一场法律争端,更是 AI 产业的一次“定价重构”。如果法院最终判定大模型公司必须为训练数据付费,AI 企业的研发成本将大幅上升,行业可能会向拥有深厚财力或拥有自有版权库的巨头集中。
与此同时,这也为中文 AI 领域提供了参考。在数据质量与版权边界日益敏感的今天,如何在追求模型性能与尊重知识产权之间找到平衡,将成为所有大模型厂商必须面对的必修课。
本文内容仅供参考,不构成投资建议。