guanweilu
-
无分类器引导(CFG Scale):调高这个参数,AI 就更听话——但代价是什么
我第一次用 Stable Diffusion 的时候,跟很多人一样,以为 CFG Scale 就是“听话程度”的旋钮:拉高一点,AI 就更听提示词的话;拉低一点,AI 就更自由发挥…
-
RLAIF(AI 反馈强化学习):用 AI 替代人类标注员做对齐,效果能比吗
你大概知道 ChatGPT 是靠人类反馈练出来的,但你想过没有,OpenAI 到底雇了多少人做标注? 根据公开信息,OpenAI 在肯尼亚、乌干达等地外包了上千名标注员,时薪不到 …
-
反向传播(Backpropagation):从输出错了到哪层参数该改,信号怎么传回去
我第一次在课上听到反向传播(Backpropagation)时,脑子里只有一个念头:这太反直觉了。神经网络明明是一层一层往前算的,得出一个错误结果后,怎么就能把责任精确地分配到每一…
-
CLIP 怎么把一句话变成模型能理解的条件?文本和图像的对齐
有一件事困扰了我很久:给 AI 一张狗的照片,它说这是狗,这我理解。但如果你给它一张完全没见过的卡通狗,然后在旁边写一句“一张卡通风格的狗”,它居然也能认出来。你甚至不用给它看任何…
-
宪法 AI(Constitutional AI):让 AI 自己监督自己——Anthropic 的对齐方案
我最早接触 AI 对齐的时候,有个问题一直困惑我:让人类通过 RLHF 给模型打分,人类自己意见都不统一,怎么保证模型学到的是对的?而且,标注员要反复看有害内容,这本身就是一种心理…
-
损失函数(Loss Function):模型怎么知道自己错了?交叉熵的直觉理解
我最早接触交叉熵的时候,心里只有一个想法:这公式也太丑了。一堆 log 和概率乘在一起,怎么就变成了“损失”?后来我才明白,它背后藏着一个扳道工的故事——而且这个故事,香农在 19…
-
工具调用(Tool Use / Function Calling):大模型怎么学会用 API的
我第一次让 ChatGPT 查天气,心里想的是:“它肯定内置了一个天气插件,我一问,它就去调接口。” 后来看文档才发现,根本不是这么回事。模型自己不会调任何 API,它只是在输出一…
-
U-Net 在扩散模型里的角色:预测噪声,而不是画图——这个区别很重要
我最早看扩散模型论文的时候,有一个细节让我卡了很久——U-Net 的输出居然不是去噪后的图像,而是当前步骤要移除的噪声。我当时觉得这很反直觉:你明明是要把人脸恢复出来,为什么不直接…
-
BLIP-2 的 Q-Former:怎么用可学习的查询把视觉特征压缩成大模型能懂的 Token
我第一次看到 BLIP-2 的架构图时,脑子里冒出一个念头:这不就是给图像特征加了个“数据库查询接口”吗? 你有一大堆从 ViT 里吐出来的图像特征,密密麻麻,语言模型根本看不懂。…
-
视觉-语言模型(VLM)的架构:视觉编码器 + 连接器 + 语言模型——为什么是这三件套
我第一次看到 VLM 的架构图时,脑子里冒出的第一个念头是:这不就是拿一个图像模型和一个语言模型,中间加个“转接头”拼在一起吗?为什么不能端到端训一个模型,直接把像素吃进去、文字吐…