guanweilu
-
Idefics 2:HuggingFace 的开源多模态模型怎么在消费级显卡上训练
我最早以为,多模态模型这种东西,是只有OpenAI这种公司才碰得起的。直到有一天我在一张RTX 3090上跑通了Idefics2的微调,才意识到这个想法早就过时了——但要真让它跑起…
-
AI 照片修复全链路:去模糊、超分辨率、人脸修复——三个不同问题的技术组合
你翻出一张 1998 年的合影。扫描,拖进修复 App,三秒后出来一个“高清版本”——衣服纹理有了,脸上的噪点没了,连眼睛里的高光都清清楚楚。你脑子里冒出一句话:AI 把当年拍糊的…
-
Agent 的注意力稀释问题:当上下文中工具描述超过 50 个,模型就开始犯迷糊
你有没有遇到过这种场面?给 Agent 接上了 50 个工具:查天气、订日历、发邮件、搜数据库……结果你让它“看看明天天气怎么样”,它居然调用了日历工具,给你创建了一个事件。工具没…
-
Prodigy 的 d 参数自适应机制:让学习率自己找到合适的大小
学习率大概是深度学习里最玄学的超参数。Adam 的默认值 1e-3 在某个任务上完美工作,换个数据集就 loss 爆炸;你把它调小一个数量级,收敛又慢得像挤牙膏。我最早以为这是运气…
-
Inference-Time Safety:不改模型权重,只在推理阶段做安全控制——有哪些方法
我最早以为,一个模型安不安全,是在训练阶段决定的。RLHF 把“拒绝有害请求”的偏好烧进权重里,像疫苗一样,打完就免疫了。 这个理解在我亲手跑了一次 jailbreak 之后碎掉了…
-
去背景技术演进:从传统抠图到 Segment Anything,AI 怎么理解前景和背景的边界
第一次用 Photoshop 的快速选择工具抠我家猫的照片时,我盯着屏幕上狗啃一样的毛边看了十分钟。人扫一眼就能说出"猫在这",计算机怎么就做不到? 这个问题困…
-
Agent 的 System Prompt 工程:如何把角色定义、工具描述、约束规则高效塞进有限上下文
2023 年,一篇论文让很多本来埋头调 Prompt 的人心里一凉:语言模型在拿长上下文做“阅读理解”时,会忽略放在中间位置的信息,哪怕那信息跟问题直接相关。这项来自斯坦福、UC …
-
大模型训练中 optimizer 的内存布局:fp32 参数 + fp32 状态 = 三倍模型大小的显存
你可能以为,训练大模型最吃显存的是模型本身。我一开始也这么想——一个 7B 参数的模型,光权重就有 14GB(fp16)。直到我第一次尝试在单机多卡上微调 7B 模型,结果还没跑完…
-
AI 安全中的博弈论:攻击者和防御者之间的动态博弈,纳什均衡在哪里
你在生产环境部署了一个图像分类模型,准确率 99.8%。我把一张熊猫图片加上一点点肉眼看不见的噪声,模型就信心十足地把它识别成长臂猿。这个故事你可能听过很多遍,但有一个问题很少被认…
-
Janus 的双向生成架构:一个模型同时做图像理解和图像生成——吉利旗下团队的新尝试
罗马神话里有一位神,叫 Janus。他不像宙斯那样掌管雷霆,也不像阿波罗那样预言未来。他管的是门。门有两面,所以 Janus 长着两张脸,一张看门里,一张看门外。罗马人把一年第一个…