guanweilu
-
端到端语音模型:直接输入音频、输出音频——跳过语音转文字这一步
第一次用 ChatGPT 的语音模式时,我有个很别扭的感觉:它反应很快,但对话节奏总像在跟一个翻译机器人说话——我说完,它停顿一下,然后字正腔圆地回我。直到看到 OpenAI 的架…
-
Seed(随机种子):同一个种子 + 同一句提示词 = 同一张图,为什么?
我第一次用 Stable Diffusion 的时候,被一个现象整懵了:同样的提示词,每次点生成,出来的图都不一样。后来朋友告诉我,你试试把那个叫 Seed 的数字记下来。我试了试…
-
规划(Planning):Agent 怎么把帮我做一个网站拆成 20 个步骤
我最早让 GPT-4 写一个完整网站的时候,就直接说:“帮我做一个个人博客网站,要好看、能部署。”然后它吐出一大段 HTML、CSS 和 JavaScript,还夹杂着“这是你的博…
-
多工具协作:一个 Agent 同时调用搜索、计算器、数据库——怎么协调
我最早用 ChatGPT 的插件功能时,有一个场景让我困惑了很久:我让它“帮我查一下今天的天气,然后根据温度换算成华氏度,同时去数据库里查一下我上次记录的体感温度偏好”。它确实能同…
-
工具调用失败怎么办?重试、降级、人工介入——Agent 的容错机制
你让Agent查天气,它调用了API,结果返回500。接下来会发生什么?是傻傻重试十次,还是直接放弃,或者换个工具?这就是Agent的容错机制要解决的问题。一个好的容错设计,不是简…
-
采样步数(Steps):步数越多画得越细,但 20 步和 50 步的差别到底在哪
我最早用 Stable Diffusion 的时候,每次出图都老老实实把步数拉到 50,心理上觉得“步数越多,画得越仔细”。直到有一天赶时间,随手降到 20 步,结果生成的图几乎一…
-
过度对齐(Over-Alignment):AI 太听话了,什么问题都拒绝回答——怎么平衡
有一次我想让ChatGPT帮我写一封辞职信的草稿,它拒绝了。理由听起来很负责任:"作为AI,我不能鼓励你做出可能后悔的决定。" 我盯着屏幕愣了五秒——它好像真的…
-
模型怎么知道该调用哪个工具?工具描述的语义匹配和少样本示例
我最早用 ChatGPT 的 function calling 时,总觉得这事有点玄。你给模型丢几个 JSON 格式的工具描述,它就能自己判断用户意图,然后选出对的工具、填上参数。…
-
采样器(Sampler)之争:DDPM、DDIM、Euler、DPM++——为什么换一个采样器图片就变了
你正在用 Stable Diffusion 画一张赛博朋克猫,提示词没变,模型没变,种子没变,只是把采样器从 Euler 换成了 DDIM——猫的姿势、光影、甚至背景里的霓虹灯位置…
-
对齐税(Alignment Tax):让 AI 更安全,它的能力会下降多少
我最早帮朋友调试一个基于Llama 2的问答机器人时,发现一个诡异的规律:用原始基座模型,让它写产品文案,创意爆棚,但偶尔会蹦出性别歧视的玩笑;换成RLHF对齐后的Chat版本,文…