guanweilu
-
Stable Diffusion 开源生态全景:从基础模型到各种衍生版的生态图谱
你有没有过这样的经历:在 Civitai 上翻模型,看到一个叫“Anything V5”的,一个叫“ChilloutMix”的,还有一个叫“Realistic Vision”的,每…
-
优化器的 epsilon 不只是防除零:数值稳定性在大模型训练中被严重低估的角色
我最早看到Adam优化器的epsilon参数时,文档写的是"term added to denominator to improve numerical stabilit…
-
通义万相 vs 可图 vs 即梦:国内三大图像生成模型的技术路线对比
你有没有遇到过这种情况:同一个提示词“雨夜,霓虹灯下的便利店,电影感”,通义万相、可图、即梦各给你一张图,风格差异大到像三个不同人画的。你以为是它们审美不同,其实从模型诞生那一刻起…
-
Yi-VL 的多模态方案:01.AI 怎么在百亿级参数上实现高效视觉理解
2024 年 1 月,01.AI 开源了 Yi-VL 系列模型,主打在百亿参数级别上实现高效的视觉语言理解。当时多模态大模型已经不少,但绝大多数走的是“大就是好”的路线——模型动辄…
-
AdamW 的 weight decay 跟 L2 正则化不是一回事——90%的人搞混的细节影响训练效果
我最早是在一本经典深度学习教材里看到这句话的:L2 正则化等价于 weight decay。之后很长一段时间,我在 PyTorch 里给优化器设 weight_decay 参数时,…
-
InternVL2 的升级:更大模型、更强数据、更好效果——开源多模态的标杆
我最早以为,多模态大模型就是把图片缩小成固定尺寸,然后丢给语言模型读像素。直到有一次,我拿一张工程图纸去试各种模型——图纸上密密麻麻的尺寸标注,连GPT-4V都读错了几个关键数字,…
-
Recraft V3:矢量图生成是 AIGC 的下一个战场,它是怎么做到的
你大概见过AI生成的图片:一只猫在太空,一个赛博朋克城市。这些图很惊艳,但如果你把它放大,就会看到一片模糊的像素。设计师用它做PPT封面没问题,但做Logo、图标、宣传物料就抓瞎了…
-
Haystack 的 Pipeline vs Agent:声明式编排和自主决策,两种范式的适用场景
我最早以为,Agent 既然能让模型自己决定调用哪些工具,那它一定比 Pipeline 高级。直到我在一个生产项目里用 Agent 做客服问答,结果它在一半请求里调用错了数据库,还…
-
Adafactor:T5 背后的省显存优化器,不存二阶矩状态也能训好模型
我最早训练模型的时候,心里只有一个优化器——Adam。所有教程都在用,所有代码都默认,我甚至没想过还有别的选择。直到我翻开T5 论文,发现他们用的竟然是一个听都没听过的名字:Ada…
-
稠密模型 vs 稀疏模型(MoE):不是所有参数都在同时工作
我最早注意到 MoE 这个词,是因为一个很矛盾的现象:Mixtral 8x7B 的官方模型卡写着总参数量 47B,但实测推理速度却接近 13B 模型。这怎么可能?如果每个参数都在工…