Getty Images AI:商业图库巨头做 AIGC,为什么强调版权清洁

2023 年 1 月,Getty Images 把 Stability AI 告上了伦敦高等法院。当时 The Verge 的报道写得很克制,但内容一点不克制:Getty 指控 Stable Diffusion 的训练集里有超过 1200 万张图来自它的图库,Stability 没有为其中任何一张付过钱。几个月后,Getty 又在美国特拉华州联邦法院追加了诉讼。

AI technology illustration

真正的反转出现在一年后:官司还没打完,Getty 自己下场做 AI 生图了。2023 年 9 月,它和 NVIDIA 合作推出 Generative AI by iStock;2024 年 1 月,Generative AI by Getty Images 正式上线

一个正在起诉别人“拿我的图训模型”的版权方,转头自己训起了模型。它凭什么觉得自己不会踩进同一个坑?

答案藏在 Getty 反复强调的那个词里——“版权清洁”。我最早以为这是个技术概念,是模型层面的某种防抄袭机制。后来读了它的授权条款和相关论文才想通:这四个字的每一个,都是法律和商业,跟模型架构没什么关系。

版权清洁,从数据源头开始:训练集只用自己的图库

Getty 的 AI 模型,训练集只有一个来源:自家图库里已经完成授权的素材。iStock 的产品用 iStock 的免版税图库,Getty Images 的产品用 Getty 的高端图库。像 LAION-5B 那种从互联网上爬下来的数据集——标注混乱、版权归属不明——完全不碰。

这一步的意义不在于“数据质量高”,而在于授权链条完整。Getty 图库里的每一张图,背后都有一份可追溯的摄影师授权协议。用它训练,等于每一步都有据可查。Stability 和 Midjourney 做不到这一点,不是因为技术不行,而是因为它们没有自己的图库——这是数据时代的“地租”。

光有数据还不够,合同和分钱才是重头戏

比训练数据更重要的是法律赔偿。Getty 的 AI 产品对每一张生成图都提供标准商业授权,并附带赔偿条款:客户因为使用生成图被起诉,Getty 兜底。对企业法务来说,这才是“版权清洁”真正值钱的地方——你不需要理解扩散模型,只需要知道出事有人赔。

再往后,是对摄影师的分成。训练集里的照片是摄影师拍的,模型学会了它们的风格,等于这些存量作品产生了新价值。Getty 的做法是设贡献者基金——iStock 上线时宣布了 300 万美元规模的盘子——同时允许贡献者选择把作品撤出训练集。它试图把“AI 抢走摄影师饭碗”的叙事,改写成“AI 赚的钱,拍照片的人也能分一份”。

训练数据干净,不等于模型画出来干净

但这里有一个我困惑了很久的问题:训练集干净,模型画出来的图就一定干净吗?

答案是否定的。扩散模型的本质是“从噪声里还原图像”,而还原过程高度依赖对训练数据的记忆。Google 团队的论文在 2023 年就演示过:用精心构造的提示词,可以把 Stable Diffusion 训练集中的原始图片“提取”出来。这不是理论上的可能,而是被系统化复现过的漏洞。

换句话说,Getty 的模型同样可能画出某张训练原图的影子。“版权清洁”能做到的,不是让模型不复制,而是让“复制了也没关系”在法律上成立——训练数据已经授权,生成结果在授权体系内销售,出纠纷走合同,而不是打侵权官司。想通这一点之后,我才意识到自己最初的思路完全反了。

它的底座是 NVIDIA Edify,但这不重要

技术层面,Getty 用的底座是 NVIDIA 的Edify 模型家族——一个模块化的多模态生成架构,图像、视频、3D 共用同一套设计逻辑。论文里给出的图像模型有 7.6B 参数,是标准的扩散模型:训练时给图片逐步加噪、学习逆向去噪;推理时从纯噪声出发,一步步还原出符合提示词的图像。Edify 的卖点是快和可控——论文报告在 H100 上能做到亚秒级出图,并且配套 LoRA 微调、参考图引导等工具,让 Getty 能提供“用你自己品牌素材定制模型”的企业服务。

Edify 还有哪些值得知道的细节?

Edify 采用级联生成:先出低分辨率,再超分到高分辨率,因此能输出最高 4K 的图。它的“模块化”指的是同一套底座可以派生图像、视频、3D 多个模型,不用各自从头训练。这些细节对理解产品有用,但跟版权清洁没有因果关系——NVIDIA 是卖铲子的,Getty 是拿铲子挖矿的那一个。

你原本以为的“版权清洁” 实际上
模型不会画出某张原图 所有扩散模型都可能记忆训练图,清洁靠合同兜底,不靠模型能力
用“正版”数据训练就行 关键是授权链条完整,并且输出也在同一授权体系内销售
它是一个技术指标 它是三件商业事的组合:数据授权、法律赔偿、利益分成

图库巨头做 AI,不是为了创新,是为了自保

为什么一个商业图库非要做到这种程度?因为图库的生意本质是权利中介:摄影师把使用权交给 Getty,Getty 加价卖给别人。AI 生图对这一模式的冲击是釜底抽薪——如果任何人三秒就能生成一张“商务人士握手”的完美图片,谁还会花几百美元买真实照片的授权?

Getty 的应对不是对抗 AI,而是把 AI 请进自己已有的权利体系:训练数据从图库里来,生成结果在授权体系内卖,收入按贡献分给摄影师。AI 不是图库的掘墓人,而是图库的新商品线。

这套体系本身也成了壁垒。一个新玩家想复制,需要三样东西:自有图库、能打跨国版权官司的法务团队、给海量贡献者分账的系统。这三样东西,Stability 没有,Midjourney 没有,OpenAI 也没有。所以你会发现,Getty 的模型能力未必最强,但它是大客户唯一敢直接签合同的 AI 生图服务。与此同时,Stability 的官司还没打完——2025 年初英国高等法院的裁决让 Getty 的侵权主张继续进入审理。两边一对比,“版权清洁”的含金量就出来了。

几个最常被问的问题

Getty AI 生成的图片,版权到底是谁的?

买家拿到的是授权,不是版权。这里还有一个更深的坑:美国版权局明确表示,纯 AI 生成的内容不受版权保护。Getty 的方式是用合同授予使用许可并承诺赔偿,让“能不能用”不依赖版权登记。它卖给你的是一个法律上可执行的使用权,而不是所有权。

会不会买到一张“抄袭”某位摄影师作品的 AI 图?

有可能。记忆效应是所有扩散模型的通病,Getty 也不能声称免疫。区别在于,如果这种相似真出现了,Getty 的合同结构会把纠纷的性质从“侵权”变成“合同问题”——而这两者的法律后果天差地别。

为什么不直接用 Stable Diffusion,再买一份保险?

因为 Stable Diffusion 的侵权发生在训练阶段——数据是爬来的,模型诞生之前侵权行为就已经完成了。保险条款通常只覆盖使用过程中的风险,不会替你兜底“训练数据本身就是偷来的”这种结构性侵权。Getty 是从源头消解问题。

摄影师真的愿意吗?

不全是。Getty 允许贡献者退出训练集,也设了基金,但很多摄影师依然认为补偿太低,或者根本不想让自己的作品成为 AI 的养料。“版权清洁”在贡献者那一端,并不是完全干净的——这是它整个体系里最不清洁的角落。

它真正的命门,是两个法律问题

到这里你应该看清楚了:Getty 的“版权清洁”不是一句营销口号,而是它给 AI 生图重建的一整套商业秩序——数据有授权、输出有赔偿、贡献者有分成。它卖的不是“AI 能画图”这个能力,而是“这张图你可以放心贴到商业海报上”这个确定性。

但这套秩序的命门,押在版权法的两个终极问题上:未经授权用公开数据训练模型,到底算不算侵权?AI 生成的内容,到底能不能获得版权?

如果第一个问题的答案是不算,Getty 的护城河会一夜蒸发——爬数据的成本几乎为零,任何人都能复刻它的模型能力。如果第二个问题的答案是不能,那 Getty 卖“授权”的根基也会动摇。而在此之前,这场豪赌赌的是企业客户对确定性的付费意愿。从目前看,这个意愿真实存在——毕竟对一家企业来说,一张图的版权纠纷可能烧掉几百万美元的律师费,而一张 AI 图的授权费,只是其中零头的零头。

原创文章,作者:guanweilu,如若转载,请注明出处:https://guanweilu.cn/article/336.html

(0)
上一篇 2026年8月28日
下一篇 2026年8月28日

相关推荐