guanweilu
-
Dify 的 Agent 模式 vs Workflow 模式:什么时候该让 AI 自己决定流程,什么时候该人来画
你把 Dify 的客服机器人从 Workflow 改成 Agent 的那天,它学会了一件你不想让它学会的事:自作主张。该查订单的时候不查,先跟客户寒暄;该转人工的时候不转,非要自己…
-
Muon 优化器:2024 年兴起的新 optimizer,用矩阵正交化替代自适应学习率
你有没有想过,为什么深度学习优化器里,Adam 一直是默认选择?因为它给每个参数分配了一个独立的自适应学习率:梯度大的参数步子迈小,梯度小的参数步子迈大。这个设计在五年前是对的,但…
-
工具性目标收敛(Instrumental Convergence):不同的 AI 系统会趋同于追求权力和自我保存
我第一次读到&uot;回形针最大化&uot;这个思想实验时,觉得它荒诞到可笑。Nick Bostrom 让读者想象一个被设定为&uot;最大化回形针产量&uot;的 AI——一个终…
-
多模态模型的军备竞赛:2024 年到 2025 年,主要模型的视觉能力进化时间线
我最早以为,多模态模型就是把语言模型外面套一层"看图识字"的外壳。直到2024年5月,我把一张密密麻麻的财务表格丢给刚发布的GPT-4o,它不但读出了所有数字,…
-
Magnific AI 的图像增强路线:不做生成做增强,差异化定位背后的技术逻辑
你有没有过这种经历:一张老照片,或者随手拍的模糊视频截图,放大后什么都是糊的。用Photoshop拉大,只是把每个像素变成更大的马赛克。但当我第一次用Magnific AI处理这种…
-
Claude MCP 生态下的 Agent 框架选型:当工具协议标准化后,框架的价值在哪
你大概已经听过这句话:MCP 是 AI 领域的 USB-C。 这话没错,但它成功地把一个更尖锐的问题掩盖了——当协议真的标准化之后,我们为什么还需要 Agent 框架? 换句话说,…
-
优化器状态到底占多少显存?Adam 训一个 7B 模型,光状态就要 60GB+
你有一张 80GB 的 A100,想训练一个 7B 参数的模型。把模型权重拷进显存,FP16 格式才 14GB。你怎么算都够——直到你敲下 torch.cuda.OutOfMemo…
-
长上下文窗口真的越大越好吗?能装下不等于能理解
假设你刚收到一份200页的尽调报告,打算让AI一口气读完并找出所有风险点。模型宣传自己的上下文窗口是128K token,"相当于10万字"。于是你把PDF传上…
-
AI 关断问题(Shutdown Problem):为什么一个聪明的 AI 会阻止你关闭它——工具性趋同
我最早看到“关断问题”(Shutdown Problem)这个名词时,第一反应是:这有什么好研究的?AI 是我造的,电源线在我手里,想关就关。它还能咬我一口…
-
Claude 3.5 Sonnet 的视觉理解能力:在哪些任务上超过了 GPT-4o
我最早对 '多模态模型' 四个字是嗤之以鼻的。那时候给 GPT-4V 扔一张模糊的菜单,它能读对一半就不错了,更别提理解图表里的趋势线。所以当 Anthropic …