你面前放着一张 CAD 总平面图,密密麻麻的线条标注着地块边界、道路红线和建筑轮廓。领导说:明天早上要看到城市鸟瞰效果图。你打开 SketchUp,开始一栋一栋地挤方盒子。一个 50 万平米的片区,建模师少说也得忙两天。而现在,有人用一句话就能生成一张以假乱真的鸟瞰图——但它是真的吗?它能不能直接拿去汇报?

这篇文章我想跟你聊聊,AI 到底是怎么把一张二维平面图变成三维城市的。这不只是渲染,而是一连串的语义理解和空间推断。
为什么不是简单喂给 AI 一张图就完事?
我最早以为,这无非是给 Stable Diffusion 丢一张 CAD 图,加上提示词就行。试了一次,效果惨不忍睹:图像模型看到的是一堆线条,它完全分不清哪根是建筑外墙、哪根是道路中心线,更不用说算对楼层数。
后来我才明白,AI 辅助城市规划可视化的第一步,不是画图,而是把 CAD 转成机器能理解的“语义层”。
所谓的语义层,就是把一条线变成“房子”,把一块颜色变成“绿地”,把一条粗线变成“主干道”。在这种有标签的图像或矢量数据里,每个区域都被赋予了类别和属性,模型才知道该往哪儿生成什么。
传统做法:写规则,而不是学规则
在 AI 火起来之前,城市建模的主流是程序化建模,典型代表是 Esri CityEngine。它靠的是一套叫做 CGA shape 的规则语法:给定地块边界和用地性质,程序自动挤出符合日照和容积率要求的体块。
这种方法的优点是精确可控,生成的模型可以直接进入实时引擎,也可以参与 GIS 分析。缺点也很明显——规则是人写的,建筑风格就那么几种,换个城市就得重新调参。
而且,从 CAD 平面图到 CityEngine 可识别的数据,仍然需要人工把闭合多段线转成带属性的面。这步工作量一点都不少。
AI 路线:从标签图到鸟瞰图
AI 想解决的问题,是让“看见平面图”和“画出效果图”之间不再隔着几天的建模工作。目前最常见的做法是分三步走。
- 从 CAD 或 GIS 里提取建筑轮廓、道路中心线和地块边界,再赋上高度、层数、功能等属性,生成一张语义分割图。这张图里每个像素都被打上标签,比如“这格是办公,高 50 米”。
- 把语义图作为条件,配合扩散模型生成鸟瞰图。这里的关键技术是 ControlNet——它能让 Stable Diffusion 严格按照输入的结构图来生成图像。也就是说,建筑轮廓在哪里,生成出来的图像里建筑就稳稳地待在那里。
- 用 LoRA 或微调模型控制风格,比如“低密度花园城市”“高密度 CBD”,把渲染氛围从概念草案打磨到汇报级别。
这套流程我在自己的小项目里跑通过。当时拿到一张总图,我先把建筑边界和高度导成一张深度图,再套一个 ControlNet 的 canny 或 depth 条件,输出效果图。地块边界不再飘,但问题是,它仍然只是一张图。
那能不能直接生成三维城市?
如果你要的不只是一张静态图,而是可以飞进去浏览的三维场景,图像扩散模型就无能为力了。这时需要换一种表示方法。
近几年,神经辐射场(NeRF)和 3D Gaussian Splatting 成了三维生成的热门底座。它们不直接输出带坐标的 mesh,而是用一个连续函数或一团高斯粒子来记录空间位置和颜色。从多张航拍图或合成的鸟瞰图出发,模型能重建出可以连续视角浏览的城市街区。
一些研究在尝试用这种思路做街区生成,比如根据语义图或文本生成“城市级”三维场景。但目前它们大多停留在视觉原型阶段:几何精度不稳定,尺度没有意义,更不用提规划指标。离能编辑、能计算的城市模型还差得很远。
两条技术路线对比
我做了个简单对比,方便你判断什么场景该用哪种方法。
| 维度 | 程序化规则建模 | AI 图像生成 | AI 三维生成 |
|---|---|---|---|
| 输入 | GIS 数据 + 人工规则 | 语义图 + 提示词 | 文本 / 低精度草模 |
| 输出 | 可量算的真三维模型 | 二维效果图 | 三维视觉场景 |
| 精度 | 精确到厘米 | 视觉近似,无法量算 | 不稳定,常出现空洞或变形 |
| 速度 | 写规则慢,生成快 | 单张图几十秒 | 训练和渲染时间长 |
| 适用场景 | 法定规划、方案推演 | 方案汇报、对外展示 | 概念体验、游戏场景 |
这张表的核心信息是:AI 图像生成最擅长的是“视觉说服力”,而不是空间准确性。它适合在打动人心这个层面上出力,不适合在需要严谨计算的地方担责。
我踩过最大的坑:把 CAD 直接丢给模型
前几个月有个练手项目,我拿到一个新区的 CAD 总图。偷懒,直接把 CAD 导出的 PNG 塞进 ControlNet 的 canny 模型,然后给了一句“aerial view of a small town”。结果出来的图非常正常,有街道、有房子、有树——唯独跟我的平面图没有半毛钱关系。
原因不难懂:CAD 画的不只是建筑的投影,还有各种辅助线、标注、轴号、尺寸。AI 不知道哪些线重要,它只能捡最粗、最连续的线当成轮廓。我后来自学了一点 GIS 操作,把 CAD 里的闭合多段线按图层分类,转成 Shapefile,再根据“层数”字段生成高度图。用这个流程,AI 才真正听懂了“建筑在哪里”。
这件事给我留下一个深刻的教训:AI 的输入图形必须“语义化”,否则模型只能自由发挥。
现实中的能力边界
如果你现在去正规规划院问,他们大概率不会用 AI 生成总鸟瞰图来报批。原因有三:
- AI 生成的画面没有地理坐标,测量长度和面积无从谈起;
- 模型会产生“幻觉”,把 50 米的高层画出 200 米高,或给湖面强加上道路和广场,因为训练数据里这些元素更容易共现;
- 输出结果不可编辑,一张图改局部,往往要整张重画。
所以,现阶段最靠谱的用法是:用 AI 做前期概念和方案汇报的“情绪图”,快速让业主看到空间感受,再用专业软件做精细模型和指标核算。
我的判断
未来三到五年,AI 不见得会端到端地把 CAD 变成一张可用的鸟瞰效果图,但一定会有大量团队把 AI 嵌入现有的城市设计工作流。真正有价值的不是“替换”,而是“融合”:AI 负责从数据中提取语义、生成视觉草稿,GIS 负责精确分析,规划师负责在关键节点做判断。
所以下一次有人拿着 AI 生成的城市鸟瞰图问你,是不是以后不用画图了。你可以回答:图确实不用画了,但看懂图之前的信息和数据采集,永远让人停不下来。
原创文章,作者:guanweilu,如若转载,请注明出处:https://guanweilu.cn/article/754.html