guanweilu
-
CrewAI 的 Process 模型:Sequential vs Hierarchical——多 Agent 协作的两种组织形态
假设你正在用 CrewAI 搭一个内容团队:一个 Agent 负责调研,一个负责写初稿,一个负责润色。你可能会纠结一个问题:这三个 Agent 是像流水线一样依次干活,还是需要一个…
-
Schedule-Free AdamW:把 warmup 和 cosine schedule 都省掉,效果反而更稳
我最早学炼丹的时候,最烦的就是配学习率 schedule。warmup 多少步、cosine 衰减到多少、peak lr 设多少——每一项都像在猜。后来我看到 Schedule-F…
-
ORPO(Odds Ratio Preference Optimization):用赔率比替代损失函数,对齐效率更高
假设你费尽心思微调了一个大模型,它上知天文下知地理,但就是不听你的话。你说“写一篇关于猫的文章”,它洋洋洒洒给你写出一篇关于狗的。你想让它语气礼貌一点,它却…
-
Claude 3 的视觉能力被低估了?和 GPT-4V、Gemini 的正面对比
把一张画满箭头和方框的架构图扔给Claude 3 Opus,几秒钟后它说:"这个支付流程里,你的回调地址没有处理超时重试,数据库写入和消息队列之间还缺事务保护。"…
-
PixArt-α:用 Transformer 替代 U-Net 做扩散,训练成本降低了 10 倍的秘密
假设你是个有野心的AI研究员,手里只有8张V100,却想训练一个自己的文生图模型。Stable Diffusion的训练成本大约在几十万美元量级,你连想都不敢想。但2023年10月…
-
自一致性(Self-Consistency):问同一个问题多次,取多数答案——粗暴但有效
你让同一个大模型解一道小学应用题。第一次它答错了,第二次它又答错了,第三次它答对了。你是不是觉得这模型随机性太强,不可靠?但如果我告诉你,有人专门利用这种随机性——问同一个问题很多…
-
机制可解释性(Mechanistic Interpretability):找到模型内部的电路——Anthropic 的研究
2022 年,Anthropic 的研究人员把一个小型 Transformer 拆开,发现了一件诡异的事:模型内部存在一些神经元,分别对 "DNA"、"…
-
Agent 的幻觉比大模型更危险:因为 Agent 不只是说错话,是做错事
想象你有一个 AI 助手,它能访问你的邮箱、日历和通讯录。今天早上它收到一封邮件,写着“周三下午三点开会”,但它把“周三”理解成了下…
-
AI 的意识问题:大模型有意识吗?这个问题本身可能就问错了
有个问题我隔三差五就会在评论区看到:『ChatGPT 到底有没有意识?』问的人通常刚跟 AI 聊完一次很走心的天,觉得它好像真的『懂』自己。而我每次看到这个问题,都有一种说不出的别…
-
图像生成模型的评估:FID、CLIP Score、人类偏好——哪个更靠谱
你花了一个月训了一个图像生成模型。现在要写技术报告,证明它比别人的好。你放两张图,一张真实照片,一张模型生成,然后说“你们自己看”?这不行。你需要数字。FID 0.18,CLIP …