guanweilu
-
指令数据从哪来?Self-Instruct 和 Evol-Instruct 怎么让 AI 教 AI
训练一个能听懂人话的 AI,最难的一步是什么?不是模型架构,不是算力——是 数据。更具体地说,是 指令数据:那种“帮我写一封辞职信”“用小学生能听懂的话解释相对论”的 prompt…
-
Transformer 架构为什么能取代 RNN 和 LSTM?不是更聪明,是更擅长并行
我最早被 RNN 折磨是在 2018 年,当时想训一个简单的对话模型。用双层 LSTM,512 隐藏单元,一张 GTX 1080 Ti 跑一个 epoch 要 40 分钟。我盯着 …
-
注意力机制——Transformer 最核心的发明,用全班传纸条就能讲清楚
假如你在课堂上,老师突然让你写一篇‘注意力机制’的总结,但你完全没预习。你只能偷偷传纸条求助。你写了张纸条:‘谁懂注意力机制?’ 传给了几个你觉得靠谱的同学,每个人都回了一张纸条,…
-
上下文窗口:为什么 AI 聊着聊着就忘了你刚才说过什么
我最近跟 ChatGPT 聊了一下午,来回二十几轮。它突然管我叫“小明”——我明明叫“阿强”。那一刻我意识到,它不是记性不好,它是压根不记得我。这件事让我开始琢磨:AI 到底是怎么…
-
Token:大模型世界里最小的字,你的名字在它眼里可能被切成三块
有一次我随手在 OpenAI的tokenizer演示页面 敲了个中文名字“张三”,点完“Tokenize”之后,我愣住了——它被切成了两个token:“张”和“三”。一个完整的名字…
-
3D 并行:数据并行 + 张量并行 + 流水线并行——大模型训练的真正工程挑战
单卡放不下?那就把模型拆开 我最早以为,大模型训练就是多买几张显卡,然后数据并行一跑就完事了。直到我亲自尝试在8张A100上加载一个70B的模型——显存直接爆了,OOM。那一刻我才…
-
多模态幻觉:多模态模型也会看图说话编造内容,为什么
去年我让 GPT-4V 描述一张随手拍的办公桌照片,它说桌上有一支 红色钢笔。我愣了一下——桌上确实有笔,但全是黑色的。更匪夷所思的是,它还说笔帽上刻着字,细节丰富到像真的一样。照…
-
分布式训练:几百张 GPU 怎么协作?数据并行、模型并行、流水线并行
我第一次碰到训练 OOM,是在一台 8 卡 A100 的机器上跑一个 13B 参数的模型。我心想,这玩意儿不是号称能装下吗?结果一个 batch 就报错。后来我才明白,&ldquo…
-
红队测试(Red Teaming):怎么系统地攻击大模型,找出安全漏洞
以前我总觉得,只要我不问敏感问题,AI 就不会说出什么出格的话。直到有一次,我让 ChatGPT 用古希腊语写一段歌词,内容是“如何制作危险物品”,它竟然照做了——还附带了详细步骤…
-
扩图(Outpainting):AI 怎么猜画面之外有什么?它猜对和猜错的原因
我最早用 AI 扩图时,犯了一个很蠢的错误 我以为 AI 扩图就像 Photoshop 的内容识别填充——把边缘像素复制粘贴,再用模糊算法糊弄过去。于是我把一张半身照扔进 DALL…