guanweilu
-
幻觉有几种类型?编造事实、张冠李戴、逻辑断裂——原因各不相同
你问 ChatGPT 一个历史问题,它回答得头头是道,连出处都有模有样。你顺手一查——人名对了,年份错了,书名是真的,作者是编的。这种事你肯定遇到过。但你可能没想过:幻觉不是一个笼…
-
基准测试的污染问题:训练数据里混进了测试题——怎么检测和避免
你有没有过这种经历:看某个大模型的评测报告,MMLU 上拿了 90 分,感觉它已经是半个博士了。结果你真让它帮你做一道大学物理题,它给你一本正经地胡说八道。你可能会怀疑是不是自己用…
-
ARC-AGI 基准测试:为什么对人类来说简单的题,对 AI 却很难
第一次看到 ARC-AGI 的题目时,我差点笑出声。一个 3×3 的彩色格子,上面画着几个形状,让你推断下一个输出。这分明是幼儿园的找规律题,哪里称得上 &qu…
-
多模态生成:同时生成文字 + 图片 + 音频,模型怎么协调不同模态
你让AI做一件事:生成一段15秒的视频,画面是一只猫在弹钢琴,背景是肖邦的夜曲,旁白用中文说"这是我的杰作"。对用户来说这是一个需求,对模型来说这是三个完全不同…
-
Chatbot Arena 和 Elo 评分:人类偏好投票为什么比自动评测更有参考价值
我一直觉得,AI 模型的排行榜是个玄学。 今天这个模型拿了第一,明天那个模型又登顶了。评论区吵成一团:有人说“分数高不代表好用”,有人说“你懂什么,这叫客观评估”。我一度很困惑——…
-
为什么说AGI 快到了和AGI 还很远都可能是对的
2023 年,OpenAI 的 CEO Sam Altman 说,AGI 可能在未来十年内到来。同一年,Meta 的首席 AI 科学家 Yann LeCun 说,现有的大模型连猫都…
-
TTS(文字转语音)的技术演进:从拼接合成到 VITS 到零样本克隆
你有没有注意过,十年前车载导航说’前方五百米右转’的时候,每个字都像从塑料管子里挤出来的?而现在,你可以让 AI 用你妈妈的声音读一段童话。这中间发生了什么…
-
RPA(机器人流程自动化)vs AI Agent:一个是录屏回放,一个是自主决策
我有个朋友在银行做运营。他们部门上了RPA,每天自动处理几千笔对账,领导觉得终于用上人工智能了。结果有次银行系统升级,按钮挪了位置,机器人瞬间瘫痪,几千笔账全卡在流程里。朋友跟我抱…
-
LoRA 的 rank 怎么选?rank 小了效果差,rank 大了跟全参微调有什么区别
我最早用 LoRA 调一个 7B 模型的时候,踩过一个很实在的坑:把 rank 从 4 调到 8,效果明显变好;调到 16,又好了一点;调到 32,几乎没变化,但训练时间肉眼可见地…
-
LLM-as-a-Judge:用大模型评估大模型——靠不靠谱
怎么判断一个 AI 回答得好不好?最靠谱的办法是请人看。但如果你在跑实验,一天要评几千条回复,请人看到月底可能比训练模型还贵。于是有人想了个偷懒的办法:让另一个 AI 来打分。这个…