阅界资讯

微软高管私下承认 AI 抓取是偷:纽约时报诉状解密,信息量极大

阅阅界编辑部3阅读2分钟

先说结论:纽约时报和 OpenAI、微软打了三年的版权官司,最近公开了一批未删减文件,里面全是猛料。微软高管私下把自家 AI 训练做法称作偷,OpenAI 自家领导层承认模型对出版商是生存级威胁。TechCrunch 9 月 17 日的报道在 HN 上拿了 955 分。

文件里点了三件事。第一,绕过付费墙悄悄拿内容,大规模抓取建训练集,还故意抹掉训练数据里的版权声明。第二,OpenAI 内部承认,自家模型对那些养活了它的人,也就是出版商和记者,构成了生存威胁。第三,微软自己的数据:Copilot 的问答引擎让时报域名的点击通过率比传统必应搜索掉了最多九成三。

微软应用科学总监 Brent Hecht 在 2024 年 1 月的内部演示里,把这叫作死亡循环:点击没了,出版商活不下去,模型和整个互联网一起变差。自己人把自家商业模式判了死刑,这种场面不多见。

当然要打个补丁:不少新料来自时报自家的案情陈述,底层证据还封着,引文也没了上下文。法官们目前大多站 AI 公司这边,训练算合理使用;本月白宫还递了辩护意见,支持 OpenAI 无许可使用版权材料训模型。但合理使用的前提是不替代原作市场,九成三的点击跌幅,恰恰往这个前提上踩了一脚。

内容创作者现在能做的有三件:先给网站配好 llms.txt,把规矩写进机器可读的文件里;再看 Anna's Archive 的范本,批量授权走一边,恶意爬虫封一边;最后把引用监测做起来,谁用了你的内容、给没给跳转,心里要有本账。等官司打完再行动,黄花菜都凉了。

国内读者看这篇,重点不在站队,在看三条线:一是 AI 搜索和内容方的账迟早要算,时报这个案子就是样板间;二是做 RAG 和 AI 搜索的人,引用和跳转不是良心活,是保命活;三是版权声明别乱抹,训练数据洗一遍,合规风险自己先过一遍。

来源|TechCrunch,HN 955 分,https://techcrunch.com/2026/09/17/microsoft-exec-called-ai-scraping-the-largest-theft-of-labor-in-human-history-new-unredacted-filings-reveal/

海外技术译文版权AI搜索诉讼

评论(0)

暂无评论,来抢第一条。