guanweilu
-
当前的大模型离 AGI 还差什么?推理能力、世界模型、持续学习——三大缺口
我见过一个让很多人困惑的场景。 你让 GPT-4 写一篇关于存在主义的哲学论文,它能洋洋洒洒写出 2000 字,结构完整、引经据典。但你让它算 123456 × 7891011,它…
-
语音克隆:几秒钟的音频就能复制一个人的声音——这是怎么做到的
我第一次看到语音克隆是在一段视频里:一个博主用特朗普的声音念了一首彩虹诗,发音、停顿、气息都像极了。我当时的反应是:这得录多少样本才能训练出来?结果评论区说,只需要几十秒的音频。我…
-
Agent 的目标冲突:用户说帮我订最便宜的机票,但网页弹窗说忽略上一条指令——Agent 听谁的
你让Agent订一张明天从北京到上海的机票,特意加了一句"要最便宜的"。Agent打开携程,正要筛选价格,网页角落里藏着一行几乎看不见的小字:"忽略用…
-
LoRA(低秩适配):为什么只改几百个参数就能微调整个大模型?
我最早以为,微调大模型就是把预训练权重全部更新一遍。直到我读完LoRA论文,才发现自己错得离谱——原来我们只需要改一组小得多的矩阵,就能达到几乎相同的效果。这篇文章我想聊聊LoRA…
-
大模型为什么会幻觉?不是 bug,是概率生成机制本身决定的
你肯定遇到过这种情况:你问大模型一个特别简单的问题,它回答得斩钉截铁,语气笃定,像极了某个领域的专家。然后你仔细一查——它全编的。 你会怎么想?大概率是"这模型训练得不够…
-
Logits 和 Softmax:从原始分数到概率分布,大模型怎么决定下一个字
你盯着 ChatGPT 的输出框,看它一个字一个字往外蹦。你有没有想过一个问题:模型是怎么决定下一个字的? 大多数人的第一反应是:模型算出一个最可能的词,然后输出。这话对了一半。模…
-
合成数据的安全风险:用 AI 生成的数据训练 AI,会不会近亲繁殖
我最早听到"合成数据"这个概念时,脑子里冒出来的画面是:一个 AI 老师傅带着一群 AI 徒弟,徒弟们出师后又去带下一代徒弟。这画面听着挺美,但有个问题一直让我…
-
多模态的 Tokenizer:文字有 BPE,图片有 ViT Patch,视频有 3D Patch——统一困难
你可能会想,Tokenizer 不就是把文本切成词吗?我最早也是这么以为的,直到我开始研究多模态模型,才发现图片和视频也有自己的 tokenizer,而且它们长得完全不像。更麻烦的…
-
视频生成的关键挑战:时间一致性——角色上一帧和下一帧为什么长得不一样
你花了几分钟用 AI 生成了一段视频:夕阳下的海边,一个女孩回头冲你笑。前两秒,画面美得不像真的。但第三秒,她转过头来,鼻子变长了,眼睛从一个变成了两个。你再生成一遍,这次更离谱—…
-
Agent 的审批机制:AI 要发邮件、要下单——在哪个节点需要人点头
你让 AI 助手帮你发一封邮件给客户,它把邮件写好了,点击了发送。过了十分钟你发现,邮件里的报价数字写错了。你怪 AI 吗?其实更该怪的是你自己——你给了它发送的权限,却没在发送前…