大模型
模型训练
AI Agent
AIGC
多模态
AI安全
多模态
图像描述在社交媒体中的应用:自动为图片生成无障碍替代文本(Alt Text)
4分钟前
多模态
图像描述中的幻觉问题:图里没有自行车,模型却说「一个人骑着自行车」
28分钟前
多模态
视觉-语言模型对图像描述的革新:不再需要单独训练,直接用提示词控制描述风格
49分钟前
多模态
图像描述的多样性:同一张图可以有多种正确的描述——怎么评估描述的质量
1小时前
多模态
多语言图像描述:用中文、英文、日文描述同一张图片——跨语言一致性
1小时前
多模态
细粒度视觉定位:不是找到「车」,而是找到「那辆银色 SUV 的左前轮」
9小时前
多模态
视觉定位在机器人操作中的应用:「把红色的杯子递给我」——机器人怎么定位目标
10小时前
多模态
Qwen-VL 的视觉定位训练:怎么用四点坐标格式让模型输出物体的位置
10小时前
多模态
多模态模型的定位能力:GPT-4V 能准确指出图中猫的位置吗——用边界框评测
10小时前
多模态
视觉定位和开放集检测的区别:一个是找到描述的物体,一个是找到所有已知类别
11小时前
多模态
1 / 7
1
2
3
4
5
6
下一页