英伟达版Sora被曝违规抓取大量数据，官方表示不服

白交 2024-08-06 14:33:42 来源：量子位

代号Cosmos，研究副总裁刘洺堉担任负责人。

白交发自凹非寺

量子位 | 公众号 QbitAI

英伟达版Sora曝光——

代号Cosmos，研究副总裁刘洺堉担任负责人。

不过随着几份内部文件的泄露，他们还被曝非法抓取数据。

（确实这也不是一次两次了……）

员工被默许每天在网络上抓取任何未经授权、未经同意数据，比如YouTube、奈飞等等这种平台上。

合起来，每天抓取的几乎是一个人80年能感知到的视觉数据。

结果英伟达回应称：我们这做法，完全合法！

英伟达版Sora曝光：代号Cosmos

据404Media所获取的泄密文件显示，英伟达每天都会抓取非法数据来训练新模型。

Cosmos的目标是构建一个最先进的视频基础模型。据泄露的邮件显示该模型集合了光传输、物理和智能的模拟，以解锁对各种下游应用。

比如被用到Omniverse 3D 世界生成器、自动驾驶汽车系统和数字人产品。

英伟达研究副总裁Ming-Yu Liu（刘洺堉）担任Cosmos的项目负责人。

他同时也是IEEE Fellow。他带领英伟达Deep Imagination研究小组，推出了NVIDIA Picasso [Edify]、NVIDIA Canvas [GauGAN]和NVIDIA Maxine [LivePortrait]等产品。

此前5月份的一封电子邮件中显示：

我们正在完成 v1 数据管道并确保必要的计算资源，以构建一个视频数据工厂，该工厂每天可以产生相当于人类一生视觉体验的训练数据。

这张图中显示英伟达首席科学家 Francesco Ferroni给了个表格链接，里面汇集了各种视频数据集，包括 MovieNet（一个包含 60,000 个电影预告片的数据库）、WebVid、 InternVid-10M，以及几个内部捕获的视频游戏镜头数据集。

如今据一位前员工爆料称，员工会被要求从YouTube、奈飞等来源来抓取数据。

他们会使用一个名为yt-dlp的开源YouTube视频下载器，它能使用虚拟机来刷新IP地址，以避免被YouTube屏蔽。

为此，英伟达向404 Media回应称：

我们尊重所有内容创作者的权利，并相信我们的模型和研究工作完全符合版权法的条文和精神。

版权法保护特定的表达方式，但不保护事实、想法、数据或信息。任何人都可以自由地从其他来源了解事实、想法、数据或信息，并用它来表达自己的观点。合理使用还保护将作品用于变革性目的的能力，例如模型训练。”

而谷歌则是扔给404 Media一个链接，今年4月YouTube CEO表示，如果OpenAI用YouTube视频来训练Sora，那么明显违反YouTube的使用条款。

而奈飞则表示，他们并未与英伟达达成内容提取协议，而且该平台的服务条款不允许抓取内容。

有意思的是，同一天，YouTube博主正在寻求对OpenAI集体诉讼，指控该公司在未通知或补偿视频所有者的情况下，使用数百万条 YouTube 视频记录来训练其生成式 AI 模型。

而此前这些大厂被曝非法抓取数据的事情也屡见不鲜。

不过必须要说的是，这种原始数据真的很有用…

之前英伟达还用游戏视频，来改善训练数据质量。

最近登上Nature封面的那篇研究显示，这种用最初互联网数据训练的大模型，具有先发优势，数据质量最好，对应的模型性能也最好。

之后随着AI数据越来越泛滥，反而容易让大模型崩溃。

Garbage in，Garbage out。

对于这件事，你怎么看呢？

参考链接：
[1]https://techcrunch.com/2024/08/05/youtuber-files-class-action-suit-over-openais-scrape-of-creators-transcripts/
[2]https://www.gamedeveloper.com/business/report-nvidia-used-scraped-video-game-footage-to-train-ai-products

[3]https://www.404media.co/nvidia-ai-scraping-foundational-model-cosmos-project/
[4]https://pivot-to-ai.com/2024/08/05/nvidia-caught-ingesting-as-much-of-youtube-as-possible/

Sora 英伟达视频大模型

白交

首个AI科学家发论文进ICLR！得分6/7/6，从选题到实验全程零人工2025-04-09
AI应用突围，中小企业的新周期已至2025-04-11
商汤大装置发放“1亿代金券”，全栈赋能场景落地2025-04-10
米哈游蔡浩宇新作iPhone实机演示：10分钟就被AI小美撩到脸红，她的命运由我掌控2025-04-07

英伟达版Sora被曝违规抓取大量数据，官方表示不服

英伟达版Sora曝光：代号Cosmos

相关阅读

英伟达：从图像中抽象出概念再生成新的图像，网友：人类幼崽这个技能AI终于学会了

如果没有StyleGAN2，真以为初代就是巅峰了：英伟达人脸生成器高能进化，弥补重大缺陷

英伟达新研究：上下文长度虚标严重，32K性能合格的都不多

NVIDIA CEO 黄仁勋发布面向各行各业的生成式 AI 平台

Sora问世，如何用大模型反诈？

RTX 3080被炒到原价7倍，最高卖5000美元，英伟达官方道歉：将打击黄牛抢购

热门文章

AI应用突围，中小企业的新周期已至

全球首个Linux开发本：50TOPS算力，DeepSeek都配好了，可随地大小开发

GPT-4o图像生成架构被“破解”了？自回归主干+扩散解码器

阿里云造“Agent工厂”，百炼MCP服务上线，无需代码5分钟建Agent

倒计时1周！20余位行业大佬共话AI，中国AIGC产业峰会最全攻略在此