AI 图像去遮挡:被挡住的物体怎么恢复——和 Inpainting 的区别在哪里

你站在广场上,举起手机拍雕像,一个游客闯入镜头,把雕像下半身挡得严严实实。事后你圈掉游客,用“AI 修复”抹除——它确实补上了,但雕像底座变成一团灰,裙摆上长出了第二根腿。这不是运气差,而是你让模型做了一件超出“修复”能力的事:你让它在做去遮挡(disocclusion),而它只会做图像补漆(inpainting)。

AI technology illustration

这两个任务看起来都是“把图的洞补上”,但机制上差了很远。下面我想借自己踩过的坑,把界限讲清楚。

Inpainting 不负责“想象”

Inpainting 是图像处理里最古老的问题之一。传统方法分两类:基于扩散的,把边缘结构慢慢“外推”进洞,靠像素梯度;基于补丁的,比如 PatchMatch,从图像其他区域搜相似方块搬进来。它们的强项是重复纹理,比如草地、墙砖;一旦洞里“本应有个物体”,它们就完全没辙。早期深度学习方案如 NVIDIA 2018 年的 Partial Convolutions 改进了边缘延续,让小洞自然,但大洞依然糊成一片,因为它只是在延伸边缘,并不理解洞里是什么。

去遮挡需要“世界模型”

去遮挡的本质,是要恢复被遮挡物体的形状、材质、位置和光影。一个杯子被人挡住,去掉人以后你要把杯口、把手、阴影全画回来。这要求模型脑子里有个“杯子”的三维模板,然后再渲染成图像。更极端地,一辆车被隔离墩挡住一半,模型得生成缺失的前车门、后视镜和轮子——它不是在补图像,而是在做条件生成。

维度 图像修复 Inpainting 去遮挡 De-occlusion
目标 填得看不出破绽 恢复被挡物体的“真实”外观
判断标准 视觉连续性 几何与语义正确
输入假设 洞里信息可推导 洞里信息完全缺失,需先验
失败表现 边缘模糊 幻觉出不存在的东西

从 PatchMatch 到 Diffusion,模型在怎么“脑补”

看看过去二十年的主流方法,你能清楚看到“脑补”能力是如何一步步变强的。

方法 核心思路 对去遮挡的短板
PatchMatch (Barnes 2009) 全局搜索相似 patch 只能复制纹理,无法生成新结构
Partial Convolutions (2018) 卷积只作用在有效像素 大洞结构瞎编
Contextual Attention (2018) 从远处特征块迁移细节 缺乏整体物体语义
LaMa (2022) 傅里叶卷积 + 感知损失 追求“合理”,不追求“正确”
RePaint (2022) 扩散模型采样循环重采样 迭代慢,结果依赖训练分布

LaMa 的关键是 快速傅里叶卷积(FFC),让感受野一下子覆盖全图,所以它能利用远处建筑的线条来延展结构。但它做的依然是把“破的地方补得像真的”,不是把“被藏起来的物体找回来”。RePaint 论文提到的方案则用无条件扩散模型,在采样时把已知像素不断拷回已知区域,模型其实在“编造”一个与周围高度协调的细节版。这个细节往往好看,但不一定是真实的那一个。

我最早也天真地以为,把遮挡物涂黑扔给 inpainting 模型就行。结果有一次,一个人像被电线杆挡住半边脸,模型补出来的脸皮肤光滑,但眼睛位置偏了三厘米,像恐怖片里的娃娃。我盯着结果看了很久才想通:模型从来不知道那里有只眼睛,它只是在用周围的皮肤纹理推一个最可能的肉色填进去。要它恢复眼睛,得让它先学会“人脸结构”,而不是“像素连续性”。

单图去遮挡,数学上就没有唯一解

从信息论角度,被遮挡区域的像素完全丢失,仅凭周围可见区域无法唯一确定缺失内容。一个黑球挡住一半,你能确定它是球还是半球吗?不能。所以模型只能做一件事:猜测一个在训练分布里最合理的结果。这就是幻觉的根源,也决定了它的能力边界。

  • 重复背景 + 小面积遮挡:成功率高,因为先验强。
  • 常见物体 + 中等遮挡:成功率尚可,模型能画出“像猫”的物体,但不能保证是你的猫。
  • 独特物体 + 大面积遮挡:基本是纯生成,离“恢复”很远。

去遮挡和 inpainting 的差别,只是 mask 大小吗?

不止。mask 小时 inpainting 也能表现良好,但一旦 mask 覆盖到一个语义完整的目标,inpainting 只会根据邻近像素做外推,而去遮挡需要跨越大块已知区域去推理物体结构。

为什么某些演示视频里的“去遮挡”效果神乎其神?

多数演示用的是“object removal”而不是真正的“恢复被遮挡目标”。它们把人/物移除后,露出来的是背景,而背景是墙面或地面这类重复纹理,模型很容易补。你拿它去恢复被挡住的独特物体,立刻露馅。

扩散模型能解决这个问题吗?

扩散模型让结果更多样、更细腻,但同样依赖训练数据中的物体先验。它从噪声生成缺失区域,本质上还是在已知边界条件下采样一个“合理”的样本,和真实物体一一对应的概率很低。

我的判断是:目前的 AI 图像去遮挡,离“把被挡住的东西恢复原样”还很远。LaMa、RePaint 这些模型只是更聪明的“补漆工”,不是“场景重建者”。在需要精确恢复的领域——比如考古、安防、医学影像——单图去遮挡在理论上不可解。真正的出路,我认为在于多模态条件:用文字描述被挡住的物体,给模型参考图,或者用多视角图像重建三维结构,让“脑补”变成“有根据的补全”。到那时,去遮挡才会有真正意义上的突破。

原创文章,作者:guanweilu,如若转载,请注明出处:https://guanweilu.cn/article/483.html

(0)
上一篇 3天前
下一篇 3天前

相关推荐