guanweilu
-
DeepSeek 的蒸馏实践:为什么他们的蒸馏模型效果这么好?
DeepSeek-R1 发布后,最让我惊讶的不是它自己有多强,而是它蒸馏出来的 7B 小模型,在数学推理基准 AIME 2024 上,分数居然超过了 GPT-4o。一个 7B 的模…
-
为什么同一个问题,每次问 AI 答案不一样?温度参数(Temperature)在背后控制
你有没有发现,同一个问题,问 ChatGPT 两次,答案经常不一样。你可能会觉得,AI 像人一样,每次的想法都会有点不同。但真相有点反直觉:模型在生成答案时,权重和输入都固定不变。…
-
视频生成和图像生成,核心区别在时间维度——AI 怎么理解动
我最早接触视频生成时,第一反应是:这有什么难的?图像生成已经那么逼真了,视频不就是一帧一帧地生成吗?每帧都是高清图,连起来就是视频。后来我看了几个早期的视频生成demo,彻底打消了…
-
对抗样本(Adversarial Examples):加一点人眼看不见的噪点,AI 就把熊猫认成长臂猿
2013年,Szegedy 等人发现了一个诡异的现象:神经网络会对一些几乎看不出区别的图片产生完全不同的分类。而真正让这个现象“出圈”的,是 2014 年 Goodfellow 等…
-
提示词工程(Prompt Engineering)在图像生成中的角色:为什么好的描述=好的图片
提示词不是被"听懂"的,是被"映射"的 你给 Midjourney 输入"一只猫",它给你一只猫。输入"一只毛…
-
DALL-E 3 和 Midjourney 的路线差异:为什么效果差距这么大,底层技术选型不同
同样一句提示词:一只戴着礼帽的橘猫坐在咖啡馆窗边,窗外下着雨,背景是霓虹闪烁的纽约街道。DALL-E 3 给你的,是一张每个元素都严格到位的画——礼帽、橘猫、雨滴、霓虹,全都在。M…
-
视觉 Transformer(ViT):把图片切成小块当 Token,跟处理文字一样
我最早看到 ViT 论文的时候,标题就让我觉得离谱:「一张图值 16×16 个词」。图片和词怎么能一样?CNN 花了二十多年才把卷积、池化、平移不变性打磨成图像识别的标配…
-
DiT(Diffusion Transformer):把 U-Net 换成 Transformer,扩散模型迎来架构换代
如果你用过 Stable Diffusion,你大概知道它背后那个叫 U-Net 的东西——一个长得像字母 U 的卷积网络,带一堆跳跃连接,被誉为扩散模型的大脑。过去几年,这个架构…
-
AutoGen、CrewAI、MetaGPT:多 Agent 框架的三种设计哲学
假如你正在用 AI 写代码,你想要的不只是单打独斗,而是让多个 AI 组队干活——一个写需求,一个画架构,一个写代码,一个做测试,最后还能自动部署。你打开 GitHub,发现有三个…
-
奖励模型(Reward Model):RLHF 里最容易被忽略但其实最关键的一环
在做 RLHF 的那段时间,我犯过一个很蠢的错误。我以为 PPO 里面的那个 Reward Model 就是个锦上添花的组件——反正都有人类偏好了,直接拿打分训练不就行了?干嘛还要…