大模型
模型训练
AI Agent
AIGC
多模态
AI安全
多模态
图像描述中的 Beam Search:为什么搜索策略对生成质量影响这么大
2天前
多模态
Show, Attend and Tell:注意力机制怎么让模型在生成描述时关注图片的不同区域
2天前
多模态
视觉定位(Visual Grounding)是什么?给模型一段文字,让它找到图中的物体
2天前
多模态
图像描述(Image Captioning)的技术演进:从编码器-解码器到视觉语言大模型
2天前
多模态
多模态 VQA 的评估:CIDEr、BLEU、ROUGE——哪种指标最接近人类判断
3天前
多模态
多模态模型的显存占用对比:推理一张图片需要多少 GPU 显存
3天前
多模态
VQA 中的常识推理:「图中的人在做什么饭」——需要知道食材和菜品的关系
4天前
多模态
多模态模型的参数量和性能关系:是不是 70B 一定比 7B 好
4天前
多模态
视频 VQA:不只是看一张图,还要看一段视频来回答问题
4天前
多模态
开放式 VQA 和二元 VQA 的区别:「这是什么」vs「这个人是男性吗」
4天前
多模态
3 / 7
上一页
1
2
3
4
5
6
下一页