-
多模态模型的推理速度对比:GPT-4V 响应 5 秒,开源模型能做到 1 秒吗
我最早注意到多模态推理速度这件事,是在一次团队选型会上。当时的场景很日常:把一张产品图丢给 GPT-4V,让它写一段营销文案。我们几个人盯着屏幕,等了差不多五秒,才开始出字。旁边有…
-
Sleeper Agent 攻击:训练阶段埋下潜伏行为,触发阶段才激活——最新的后门研究
假如你是一家公司的安全负责人。你部署了一个代码生成助手,它在平时表现完美——不写脏代码,不引用危险API,甚至会提醒你补上CSRF防护。但某个周四下午三点,一个工程师在代码里敲了一…
-
小模型的大能力:3B 参数以下的多模态模型能做什么、不能做什么
我最早对 3B 以下的多模态模型是有点鄙视的。那时候玩惯了 70B 的模型,觉得 3B 参数能干什么?视觉问答不就是把图片转发给大模型,让它猜吗?直到有一次,我在一台没有 GPU …
-
Dify 的 Agent 模式 vs Workflow 模式:什么时候该让 AI 自己决定流程,什么时候该人来画
你把 Dify 的客服机器人从 Workflow 改成 Agent 的那天,它学会了一件你不想让它学会的事:自作主张。该查订单的时候不查,先跟客户寒暄;该转人工的时候不转,非要自己…
-
Muon 优化器:2024 年兴起的新 optimizer,用矩阵正交化替代自适应学习率
你有没有想过,为什么深度学习优化器里,Adam 一直是默认选择?因为它给每个参数分配了一个独立的自适应学习率:梯度大的参数步子迈小,梯度小的参数步子迈大。这个设计在五年前是对的,但…
-
工具性目标收敛(Instrumental Convergence):不同的 AI 系统会趋同于追求权力和自我保存
我第一次读到&uot;回形针最大化&uot;这个思想实验时,觉得它荒诞到可笑。Nick Bostrom 让读者想象一个被设定为&uot;最大化回形针产量&uot;的 AI——一个终…
-
多模态模型的军备竞赛:2024 年到 2025 年,主要模型的视觉能力进化时间线
我最早以为,多模态模型就是把语言模型外面套一层"看图识字"的外壳。直到2024年5月,我把一张密密麻麻的财务表格丢给刚发布的GPT-4o,它不但读出了所有数字,…
-
Magnific AI 的图像增强路线:不做生成做增强,差异化定位背后的技术逻辑
你有没有过这种经历:一张老照片,或者随手拍的模糊视频截图,放大后什么都是糊的。用Photoshop拉大,只是把每个像素变成更大的马赛克。但当我第一次用Magnific AI处理这种…
-
Claude MCP 生态下的 Agent 框架选型:当工具协议标准化后,框架的价值在哪
你大概已经听过这句话:MCP 是 AI 领域的 USB-C。 这话没错,但它成功地把一个更尖锐的问题掩盖了——当协议真的标准化之后,我们为什么还需要 Agent 框架? 换句话说,…
-
优化器状态到底占多少显存?Adam 训一个 7B 模型,光状态就要 60GB+
你有一张 80GB 的 A100,想训练一个 7B 参数的模型。把模型权重拷进显存,FP16 格式才 14GB。你怎么算都够——直到你敲下 torch.cuda.OutOfMemo…