微軟高管私下承認 AI 抓取是偷:紐約時報訴狀解密,信息量極大
先說結論:紐約時報和 OpenAI、微軟打了三年的版權官司,最近公開了一批未刪減文件,裏面全是猛料。微軟高管私下把自家 AI 訓練做法稱作偷,OpenAI 自家領導層承認模型對出版商是生存級威脅。TechCrunch 9 月 17 日的報道在 HN 上拿了 955 分。
文件裏點了三件事。第一,繞過付費牆悄悄拿內容,大規模抓取建訓練集,還故意抹掉訓練數據裏的版權聲明。第二,OpenAI 內部承認,自家模型對那些養活了它的人,也就是出版商和記者,構成了生存威脅。第三,微軟自己的數據:Copilot 的問答引擎讓時報域名的點擊通過率比傳統必應搜索掉了最多九成三。
微軟應用科學總監 Brent Hecht 在 2024 年 1 月的內部演示裏,把這叫作死亡循環:點擊沒了,出版商活不下去,模型和整個互聯網一起變差。自己人把自家商業模式判了死刑,這種場面不多見。
當然要打個補丁:不少新料來自時報自家的案情陳述,底層證據還封着,引文也沒了上下文。法官們目前大多站 AI 公司這邊,訓練算合理使用;本月白宮還遞了辯護意見,支持 OpenAI 無許可使用版權材料訓模型。但合理使用的前提是不替代原作市場,九成三的點擊跌幅,恰恰往這個前提上踩了一腳。
內容創作者現在能做的有三件:先給網站配好 llms.txt,把規矩寫進機器可讀的文件裏;再看 Anna's Archive 的範本,批量授權走一邊,惡意爬蟲封一邊;最後把引用監測做起來,誰用了你的內容、給沒給跳轉,心裏要有本賬。等官司打完再行動,黃花菜都涼了。
國內讀者看這篇,重點不在站隊,在看三條線:一是 AI 搜索和內容方的賬遲早要算,時報這個案子就是樣板間;二是做 RAG 和 AI 搜索的人,引用和跳轉不是良心活,是保命活;三是版權聲明別亂抹,訓練數據洗一遍,合規風險自己先過一遍。
來源|TechCrunch,HN 955 分,https://techcrunch.com/2026/09/17/microsoft-exec-called-ai-scraping-the-largest-theft-of-labor-in-human-history-new-unredacted-filings-reveal/
評論(0)
暫無評論,來搶第一條。