一份2023年1月的内部备忘录最近被曝光,微软应用科学总监Brent Hecht在其中提到,AI抓取被他视为“人类历史上最大规模的劳动盗窃”。这一评估出自于一家正在开发生成式AI的公司的高层,而非外部的评论。Hecht进一步描述这种现象为“空前规模的惊人盗窃”。
他指出,生成式AI可能对某些人的职业产生“真实风险”,这些人往往在不知情或不情愿的情况下为AI模型提供了训练数据。也就是说,这些被用来训练模型的内容来自一群创作者,而最终最可能被取代的,也很可能是这些创作者。Hecht将这种现象称为“末日循环”理论。由此可以看出,大语言模型有潜力在本质上破坏自身的内容供应链。
微软内部的研究显示,与其传统搜索引擎Bing相比,Copilot可能导致用户点击《纽约时报》的链接减少多达93%。这一对比不仅涉及聊天机器人,还关系到同一公司的用户习惯。在用户从“点击网站查看原文”转变为“直接在对话中获取答案”时,内容提供者所遭受的流量损失尤为明显。 千亿球友会
《纽约时报》在2023年起诉微软和OpenAI,控告其未获授权复制和使用其受版权保护的作品。微软CEO萨提亚·纳德拉表示,如果他早知道OpenAI在抓取付费内容,他会要求重新训练模型以排除那些受保护的数据。与此同时,OpenAI被指控在将材料加入大型数据集之前,移除了版权声明,以防止模型再向用户返回这些版权提示。
关于使用受版权保护内容的争论仍在继续,而OpenAI的诉讼案件尚未完全结束。目前,特朗普政府已表态支持OpenAI等AI公司,认为限制大型语言模型的发展会妨碍创造性和科学进步,也影响美国的经济流动性。微软高管的警告与政府的支持形成鲜明对比,预计这场争论将持续数年,受到AI抓取影响的也不仅仅是《纽约时报》,还有数百家其他出版机构,均可能卷入这一由未经请求的数据抓取引发的竞争。
发表评论