guanweilu
-
中文模型的 Tokenizer 怎么训?用字、用词、还是用子词?三种路线的优劣对比
我最早给中文模型训 Tokenizer 的时候,干过一件蠢事:直接把英文 BPE 的脚本搬到中文语料上跑。等词表出来,我翻了几页,一脸疑惑——里面有"人工智能"…
-
位置编码的外推问题:为什么模型训了 4K 长度,直接用 8K 就会崩溃
如果你把一个训练长度只有 4K 的模型直接拿去读 8K 的文本,结果不是“后面那 4K 内容它记不住”,而是从第 4097 个 token 开始,困惑度像断崖一样往上跳——模型开始…
-
Aegis Guard:NVIDIA 的多层安全防护方案——输入和输出的双重保护
凌晨两点,你的运维电话响了。你负责的客服 AI 被人套出了一句话——它把藏在系统提示词里的完整指令原封不动复述了出来,还附赠了一段怎么在网上制造恐慌的教程。你封了那个账号,把系统提…
-
多语言图像描述:用中文、英文、日文描述同一张图片——跨语言一致性
你有没有试过让一个多模态大模型用不同语言描述同一张图?我的第一次尝试是这样的:给了一张一只柯基趴在草地上的照片,用中文问"这是什么?",回答"一只柯基…
-
AI 建筑设计概念图:从草图到效果图,建筑师怎么用 Stable Diffusion 加速出图
如果你问一个建筑师为什么总在熬夜,十有八九不是在画图,而是在有效推敲和无效渲染之间反复横跳:方案还想改,但渲图太慢了,只好先渲出来看看再说。 我第一次把 Stable Diffus…
-
Agent 操作 NoSQL 数据库:MongoDB、Redis、Elasticsearch——不同的交互模式
三种数据库会给你三种不同的脸色 有一个问题困扰了我很久:让一个 Agent 同时操作 MongoDB、Redis、Elasticsearch,最难的是什么? 最早我以为是语法。Mo…
-
词表大小对训练的影响:32K、50K、100K 词表,哪个训练效率最高?
有一段时间我特别迷信“词表越大,训练越快”这个说法。理由是:词表越大,一段文本被切成的token数量就越少,序列越短,模型的训练计算量自然就越小。这个逻辑看着毫无破绽。直到我把一个…
-
NTK-Aware 插值:不改模型参数就能扩展上下文窗口,背后的数学原理是什么
我最早试过把 LLaMA 的上下文窗口从 2048 扩到 8192。当时社区里流行的做法是线性缩放:位置索引除以 4,然后直接推理。结果模型开始输出乱码——不是质量下降那种,是彻底…
-
电路完成度评估:怎么判断我们发现了一个行为的完整电路还是只是一部分
你的电路图可能是假的 你花了一个月,用激活修补把模型里跟某个行为有关的组件挑了出来:四个注意力头,三条残差流边。你画了一张漂亮的结构图,写成博客。可就在准备发布之前,你随手做了一次…
-
细粒度视觉定位:不是找到「车」,而是找到「那辆银色 SUV 的左前轮」
停车场里的一句人话,难倒了整个检测系统 假如你站在停车场,对着一台搭载了视觉识别系统的机器人说:“帮我把那辆银色SUV的左前轮擦干净。” 机器人大概率会先给你一个整车框,然后在框上…