guanweilu
-
多头注意力(Multi-Head Attention):为什么需要多个头同时看一句话
我最早接触到多头注意力时,脑子里蹦出的第一个疑问是:这跟多线程是一个意思吗?一个头不够用,多来几个就能提速?后来啃完原始论文才发现,我完全搞错了方向。多头不是为了让模型算得快,而是…
-
社会偏见在 AI 中的表现:性别、种族、职业——为什么 AI 会歧视
有件事困扰了我很久。每次用 AI 绘图工具生成“医生”的照片,十张里有九张是白人男性;换成“护士”,画面立刻变成女性,而且多数是亚洲面孔。最初我以为只是巧合,直到我刻意测试了“CE…
-
SAM 2 的进步:从分割图片到分割视频——加了一个记忆机制
你可能会觉得,让 AI 分割视频,不就是把图片分割连起来吗?SAM 2 的论文一出来,这个直觉就被打脸了。如果只是简单地把逐帧分割结果拼接,那个物体一旦被遮挡一下,就再也找不回来了…
-
SD3 和 Flux:新一代扩散模型引入了什么?DiT 架构和流匹配
SD3 发布的时候,有一个细节社区讨论了很久:它没有叫 SDXL 2,而是直接跳到了第三代。我当时第一反应是“架构肯定有大改”,但真正让我愣住的,是 Stability AI 把整…
-
Agent 的角色分工:规划者、执行者、评审者——各干什么
有一次我让一个所谓的“全能 Agent”帮我写一个数据分析脚本,要求很简单:读取 Excel,清洗数据,画几张图。结果它上来就写代码,写完发现忘了装依赖库,装完依赖库又发现数据格式…
-
RLHF(人类反馈强化学习):让模型学会看人眼色的那一步,完整流程拆解
我曾经以为,ChatGPT 之所以能这么流畅地跟我对话,能回答问题、写代码、还能拒绝不当请求,是因为它读遍了互联网上所有的文字,自然而然地就学会了这些能力。但后来我试了几个开源模型…
-
自注意力(Self-Attention)到底在注意什么?一个句子里的每个词怎么互相看
你正在读这句话:"我把苹果放进了冰箱,它很好吃。" 那个'它'指的是什么?苹果还是冰箱?你大概半秒就懂了,但让机器理解这个,NLP研究者在很…
-
图像分割(SAM):Meta 的分割一切模型,为什么是计算机视觉的 GPT 时刻
去年四月,Meta 放出一篇论文,我看到标题的时候愣了一下——Segment Anything。不是“分割某类物体”,不是“在COCO上达到SOTA”,是“任意东西”。 我当时脑子…
-
SDXL 比 SD 1.5 强在哪?不只是分辨率更大,架构上做了哪些改动
我最早用 SD 1.5 生成一张 1024×1024 的图时,经常遇到一个诡异现象:人头变成两个,或者本该是手的部位长出了第三只脚。我以为是提示词没写好,反复调参数,还是…
-
多 Agent 的通信协议:Agent 之间怎么对话?自然语言还是结构化消息
我第一次让两个 AI Agent 协作写代码时,犯了一个很低级的错误——我让它们用自然语言直接聊天。结果一个 Agent 说“请把那个函数放到 utils 里”,另一个回“好的,我…