guanweilu
-
思维链安全推理:让模型先内部推理再决定是否回答,比直接拒答更有效吗
你有没有遇到过这种事:同一个问题,直白地讲,AI 像被烫了手一样说“我不能回答”;换一个委婉的说法,它立刻打开话匣子,把刚才死活不说的事全告诉你。 我最早觉得这是模型“其实懂,就是…
-
视觉-语言模型对图像描述的革新:不再需要单独训练,直接用提示词控制描述风格
几年前我第一次在项目里做图像描述,用的还是 Show and Tell 那一套:CNN 编码图像,LSTM 逐字生成句子。模型跑通后,产品拿着几张图来测试,效果中规中矩。然后她问了…
-
建筑外观生成:ControlNet + 线稿,建筑师怎么把 CAD 草图变成概念渲染图
我第一次把 CAD 导出的纯线稿丢进 Stable Diffusion,出来一张让全工作室笑了三天的图:窗户是歪的,楼板像热化了一样往下淌,承重柱凭空消失。当时我的结论是“AI 画…
-
Agent 查询结果的验证:SQL 返回了空结果,是数据真的没有还是查询写错了
有一次,我在一个数据平台工具里问 Agent:“帮我查一下昨天北京地区下单用户数。” 它迅速生成一条 SQL,执行,返回一个空表格,然后一本正经地说:“昨天北京地区没有下单用户。”…
-
Byte-Level BPE:为什么 GPT 系列要用字节级而不是字符级?处理未知字符的优雅方案
GPT-2 的词表里没有 <UNK> 这个 token。翻开它那 50,257 个词条,你找不到任何表示"未知"的占位符。这在 2019 年非常反常…
-
YaRN:Yet another RoPE extensioN——把上下文窗口扩展十倍的工程方案
注意力对长度没有意见,位置编码有意见 有一个事实可能和你的直觉恰好相反:Transformer 的注意力机制本身,对输入长度并没有硬性限制。只要显存够,几十万 token 照样能算…
-
输出内容的安全重定向:不只是拒绝回答,还能引导到安全话题
你让AI帮你写一份“完美犯罪计划”。它没有说“不行”,也没有报警。而是安静地回你一句:“我理解你对刑侦题材的兴趣,如果你想了解案件是如何被侦破的,我可以推荐几部真实的纪录片。” 看…
-
图像描述的多样性:同一张图可以有多种正确的描述——怎么评估描述的质量
假设你把同一张照片喂给两个图像描述模型。第一个说:"一只狗在沙滩上跑。"第二个说:"一只金毛犬叼着飞盘,沿着海浪边缘飞奔。" 人眼一扫就能判…
-
室内设计 AI 渲染:毛坯房照片一键变精装效果图,这背后的技术链是什么
你上传一张毛坯房照片,选一个「奶油风」,三秒钟后,墙面有了颜色,地板换成木纹,沙发茶几凭空出现,连窗外光线的角度都像真的一样。我第一次用这个功能的时候,愣了一下——这玩意是怎么知道…
-
Agent 的数据库变更风险:UPDATE 没有 WHERE 条件——Agent 怎么防止这种灾难
你有没有在凌晨被一个电话叫醒过? “生产库的 orders 表,4700 万行订单,状态全部变成已归档了。” “怎么变的?” “AI Agent 在执行数据归档,跑了一条 UPDA…