Molmo 和 Pixmo:AI2 开源多模态模型的训练透明化实验——数据和代码全部公开

我最早以为,开源模型就是源代码公开。后来发现自己太天真了。模型训练里有三样东西:代码、权重、数据。前两样很多模型都公开了,唯独数据,几乎没人公开。为什么?因为数据才是最值钱的。

AI technology illustration

去年我试图复现一个开源多模态模型的实验。作者在论文里写了模型结构、训练超参数,但训练数据只给了一句话:"我们使用了公开数据集。"我发邮件问具体是哪些数据集,作者回复说"涉及商业许可,无法公开"。那一刻我意识到,所谓开源,其实只是开放了模型的一半。

直到我看到 AI2 的 Molmo 和 PixMo,才发现原来真的有人愿意把训练数据也摊开给大家看。这个项目最吸引我的不是模型性能,而是它的"训练透明化"实验:模型权重、训练代码、完整数据集,全部公开。在官方项目页上,AI2 明确写着:我们不仅发布权重,还发布用于训练模型的数据集和代码,以便研究社区可以完整地复现和构建我们的工作。

开源模型,其实是半个开源

你可以去看看那些号称"开源"的多模态模型。模型权重下载没问题,部分训练代码也能拿到,但训练数据呢?大多数要么说"来自网络",要么给你一个申请表单,要么干脆不回应。你永远无法知道模型的某些行为是数据导致的还是架构导致的。

Molmo 团队做了一个相反的选择。他们在技术报告里详细描述了数据收集过程,还把数据集本身也公开了。这意味着什么?意味着你可以亲自跑一遍完整的训练流程,从原始数据到最终模型,每一步都看得见。这在多模态模型里极其罕见。

PixMo 数据是怎么造出来的

PixMo 是 Molmo 专用的训练数据集,在Molmo 的 GitHub 仓库里可以找到完整的说明。我觉得最有意思的有两点。

第一,用语音描述图像。传统数据标注是让标注员打字写描述。但人打字慢,而且写出来的文字往往很正式、很简短。Molmo 团队让标注员对着图像说一段话,然后用语音识别转成文本。因为说话比打字快很多,而且口语化的描述更自然、更详细。举个例子,一个打字标注员可能写"一个男人在街上走",但语音描述可能是"一个穿着蓝色夹克的男人正走过斑马线,后面有一辆红色巴士,旁边还有一只狗"。这样的描述对模型理解图像细节非常有价值。

第二,点标注。标注员不仅要描述图像,还要用鼠标点击图像中的物体,说出它的名字。比如,在一张街道照片里,标注员点击一辆车,说"车"。这就产生了一个"点"和对应的词。模型学习之后,不仅能识别物体,还能理解"这个物体在这个位置"。这种能力对视觉定位、交互式问答特别重要。

整个数据收集过程可以拆成几步:

  1. 筛选图像,覆盖各种场景和物体。
  2. 让标注员用语音描述图像内容,同时用鼠标点击关键物体并说出名称。
  3. 对语音进行自动转录,生成文本描述。
  4. 质量过滤,去掉错误或低质量的标注。

整个 PixMo 数据集包含大约 60 万张图像的标注(见技术报告),这个规模在今天的多模态训练里算是很小的。但 Molmo 团队相信,质量比数量重要。

数据多不如数据精

我最早也信奉"数据越多越好",直到自己做过一次数据清洗才发现,垃圾数据会让模型学到大量噪声。Molmo 团队的一个核心发现是:数据质量比数量更重要。他们只用了数十万张图像,但在多个基准上追平甚至超过了用大规模数据训练的模型。仔细想想也对,一千万张模糊的图片描述,可能不如十万张精确的标注有用。

论文里,他们明确说:

精心筛选和标注的数据,可以比大规模爬取的数据更有效。

这个结论听起来简单,但真正敢于用少量数据去挑战大厂模型的团队并不多。因为一旦效果不好,别人就会说"你数据太少了"。

透明化到底有什么用

为什么要公开数据?这里列几个我认为最重要的原因:

  • 可复现性:论文里的实验结果可以被验证。如果一个结果无法复现,那它可能只是运气。
  • 可分析性:研究者可以检查数据中的偏见、错误,然后针对性地改进。比如你想研究"为什么模型会把护士识别为女性",有了数据你就能看训练集中是否全是女性护士图像。
  • 可复用性:PixMo 数据集可以用于训练其他模型,或者作为数据构建的参考。
  • 可教学性:学生可以完整看到"从数据到模型"的流程,而不是只看一个黑盒。

下面这张表可以看清 Molmo 和传统"开源"模型的区别:

维度 传统"开源"多模态模型 Molmo
模型权重 公开 公开
训练代码 部分公开 公开
训练数据 不公开或模糊 完全公开(PixMo)
数据收集过程 黑盒 详细文档
可复现性 不可复现 可复现

这个实验的局限在哪里

这个实验并不完美。首先,数据收集成本高。语音标注和点标注都需要大量人工,不是所有团队都有这个资源。所以 Molmo 的方法可能无法直接复制。

其次,公开数据有隐私风险。PixMo 包含真实人物和场景,AI2 虽然做了脱敏处理,但任何数据集都无法完全消除隐私问题。这可能让一些机构对开源数据望而却步。

再次,Molmo 的性能并非全面领先。它在学术基准上很接近 GPT-4o,但在开放域对话、复杂推理等任务上,跟顶级闭源模型还有差距。透明化不等于更强,它只是让差距看得见。

为什么这件事值得关注

我原来以为,开源就是源代码开放。现在我觉得,真正的开源应该包括数据。代码只是实现思路,数据才是模型知识的来源。Molmo 没有发明新的架构,也没有刷爆所有榜单,但它做了一件更有价值的事:把厨房门打开,让所有人看到菜是怎么做出来的。

这当然不是一个完美的解决方案。但它提供了一个基准:如果未来所有模型都能像 Molmo 一样公开数据,那么关于模型偏见、安全、能力的争论,就不再是猜测,而是可以被检验的实证研究。

所以,Molmo 和 PixMo 不只是两个模型和数据集,而是一次关于"透明"的实验。这个实验值得关注,因为它把问题的定义从"模型能不能开源"变成了"数据能不能开源"。

原创文章,作者:guanweilu,如若转载,请注明出处:https://guanweilu.cn/article/304.html

(0)
上一篇 2026年8月26日
下一篇 2026年8月26日

相关推荐