大模型
模型训练
AI Agent
AIGC
多模态
AI安全
多模态
视频描述(Video Captioning):从单帧描述到时序描述——需要理解动作和事件
1天前
多模态
密集描述(Dense Caption)和区域描述的差异:一个给全图,一个给局部
1天前
多模态
图像描述中的细节丢失:模型说「一个人和一只狗」,但没说狗是什么品种
1天前
多模态
多模态大模型的图像描述能力:GPT-4V 和专用模型的描述有什么不同
1天前
多模态
图像描述的评价指标:CIDEr、SPICE、METEOR——哪个和人类判断最一致
1天前
多模态
Grounding SAM:Grounding DINO + SAM = 自动检测 + 自动分割的完整方案
1天前
多模态
Grounding DINO:怎么把目标检测和文本描述结合起来——开放集检测的突破
1天前
多模态
视觉定位的数据集:ReferItGame、RefCOCO、RefCOCO+ 有什么区别
1天前
多模态
自我批评训练(Self-Critical Training):用强化学习让模型自己改进图像描述
2天前
多模态
Dense Captioning:不只描述整张图,还要给每个区域写说明——结合了检测和描述
2天前
多模态
2 / 7
上一页
1
2
3
4
5
6
下一页