岑明博士毕业于中国科学院光电技术研究所,获光学工程博士学位。他曾任重庆邮电大学自动化与机器人工程系主任,也曾在汽车电子与嵌入式系统研发中心担任软件系统分析师与副主任。他的研究涵盖信息融合、多目标跟踪、自动驾驶与智能机器人,是中国自动驾驶领域的代表性研究者之一。

从电气自动化到信息自动化,再到如今的智能自动化,岑明既见证也推动了自动化领域的技术跃迁。他强调,技术的终极目标是做到彻底的易用。围绕自动驾驶与大模型的结合如何提升车辆的感知力与知识面,他致力于打破功能型自动驾驶车辆之间的孤岛,攻克各类场景中的“最后一公里”难题。

他坚信模块化是低成本开发的关键,主张通过任务建模与通用功能标准化来实现。作为开源社区的坚定拥护者,他明白技术真正的力量在于共享与协作——AI 与开源社区必须携手走向未来。

GOSIM 很荣幸邀请到岑明教授,与全球技术人分享他的见解。在 GOSIM CHINA 2024 大会上,他带来了题为《功能型自动驾驶车辆的任务建模方法》的精彩主题演讲。会后,GOSIM 对话栏目 Open AGI Forum 独家邀请他与 CSDN《新程序员》执行总编唐小引(Echo Tang)展开对谈,回顾自动化的演进,并深入探讨大模型在自动驾驶中的应用、车辆安全与模块化编程等话题。

对话亮点:

  • 大模型在自动驾驶中最直接、最有效的应用是仿真。

  • 把人的经验与大模型结合起来,可以形成一种混合方案。模型尚不成熟时,规则占 60%,模型占 40%;随着模型成熟,规则逐渐转为建议性的,决策越来越多地交给 AI。

  • 技术迭代提供了新的解法,但经验积累的价值依然不可否认。

  • 功能型自动驾驶车辆能够打破自动化孤岛,解决物流“最后一公里”的难题。

  • 安全技术本身不是瓶颈——自动驾驶的安全性能与成本正相关。

  • 一项技术要走向成熟并大规模普及,必须变得好用。大模型正在让每个人都能成为设计者。


1. 自动化的十年:从“电气”到“智能”

Echo Tang: 您学的是光学工程,却多年专注于自动化与系统集成。您是怎么走上这条路的?

岑明: 光学工程并不只是图像处理或者镜片。光学中有一个重要方向是光束控制。比如当一个光学设备需要瞄准或跟踪目标,而这个目标又在运动时,我们该如何精确地识别并提取它?这涉及控制与信号处理,本质上就是自动化的课题。所以光束控制与自动化是深度相通的。

Echo Tang: 重庆邮电大学的自动化与机器人工程系很有名。能介绍一下它的特色吗?

岑明: 这个系最早叫自动化系,是自动化学院下最早成立、也最强的专业。随着领域拓展,我们又引入了车辆工程、机器人等新学科,系名也随之做了调整。

早期的自动化主要围绕传统的电气自动化,计算机在控制系统中扮演关键角色。但基于电气的自动化系统在环境变化时适应性不足。为了提升灵活性,我们用软件替代了部分硬件功能,使其能通过软件刷新实时更新。这种做法不仅降低了成本,也大幅提升了控制系统的灵活性与功能性。

随着人工智能的兴起,仅有信息自动化已经不够了。我们系逐步从传统自动化转向智能自动化。自动化经历了三个关键阶段:电气自动化 → 信息自动化 → 智能自动化,这是一个自然的演进。无论是机器人还是车辆,我们都看到了从传统到智能的转变。工业机器人正在演变为智能机器人,车辆也从电动化走向智能化,如今进入了自动驾驶阶段。过去十年,我不仅见证了这场转变,也亲身参与其中。

Echo Tang: 在自动驾驶和机器人领域,具身智能已经成为热词,尤其是在大模型兴起之后。很多创业者正涌入这个方向,认为它是通往 AGI 的关键路径。您怎么看?

岑明: 很多领域其实高度重叠。以自动驾驶为例,它一直是摄像头、雷达、惯导与控制系统的融合。在设计一辆自动驾驶车时,如果我们加上机械臂呢?它能不能承担搬运任务?如果加上摄像头呢?它能不能成为巡逻车?如果装上清扫系统,它是不是就成了自动清扫车?

到这个时候我们就要问了:它还是一辆车吗?它是车辆还是机器人?从汽车的角度看,这些是功能型自动驾驶车辆;从机器人的角度看,它们可以算作智能机器人或移动机器人。同一个实体,从不同角度看,就有了不同的身份。

具身智能这个词,是为了把实体机器人与聊天机器人或者无实体的 AI 区分开来。与纯对话式 AI 不同,现代机器人融合了移动、感知与智能。相比纯虚拟的智能体,具备物理形态、移动能力与传感器的机器人被称为具身智能。但从根本上说并没有实质差别,很多区分只是用词的问题。


2. 大模型让车辆“看得更多,知道得更多”

Echo Tang: 您有没有想过自动驾驶该如何与大模型结合?

岑明: 短期来看,我认为大模型最立竿见影的应用是仿真。为什么智能车还不够智能?因为它见得不够多。这些车 99% 的时间行驶在正常的天气和路况下,很少遇到异常场景——比如极陡的山路、恶劣天气或严重拥堵。如果依靠真实世界采集数据,哪怕积累少量数据也要花很长时间。

用现有车载数据训练出来的车辆,在正常道路上表现良好,但如果突然把它放到山路上,系统就失灵了。因为这些车主要是用晴天数据训练的,它不知道该如何应对极端条件。

我们该如何生成数据,来确保车辆经历完整的场景谱系?我们可以采集真实场景数据,但有些条件因为成本高、机会少而难以捕捉。这时就轮到智能来生成数据了。平原城市的厂商很难频繁接触山路,但我们可以录制一段山路,让大模型学习,再生成各种异常的山路场景。这种做法提升了效率、降低了成本,让 AI 去生成那些难以采集的数据。通过补上缺失的场景,车辆获得了更广的覆盖面,因而比常规车辆更聪明。就目前而言,这是一个可以立即落地、切实可行的方案。

重庆已经有一些立项的项目开始探索这个方向。车厂正在开发生成式仿真系统,测试它用于车辆训练的可行性。很多数据集是重复的,而我希望生成的是车辆从未遇到过的数据——那些无法通过传统手段采集的数据,可以用仿真造出来。

仿真数据的质量还需要进一步研究。概念是清晰的,但落地还有大量工作要做。不过由于这些数据是系统生成的,并不直接控制车辆,所以风险与可靠性方面的顾虑相对可控。用基于仿真的方式来引入大模型,既可行也可靠。

另一条路是完全的端到端实现。但这样的大模型要训练到什么程度才算够?一旦它变成一个彻底的黑箱,人们就会不安——我们不知道它是否真的按预期工作。

当大模型被提出来作为构建可靠自动驾驶系统的方式时,实际结果未必能增加信任。因此我们可以引入基于人类经验的规则。但也要考虑这些规则是不是太僵硬。要不要把左转右转这类规则集成到模型里?这些规则不会是硬约束,而是系统中的加权因子。模型不成熟时,规则可以占 60%,模型占 40%;随着模型成熟,规则变得更偏建议性,更多依赖模型的决策。落地时应该是一种混合方案,根据成熟度动态调整。

当然,这也带来新的挑战:当这两套规则冲突时,我们该如何裁决?技术迭代就是这样运转的——没有哪项技术是完美的。大多数技术提供了很好的解题思路,但这不意味着它们能取代过去所有的积累。

Echo Tang: 如果所有参数都设置得当,系统能够应对一般场景吗?

岑明: 我们需要把指令参数分离出来,形成一个形式化的任务定义。任务定义应该是可编辑的,让指令能够传递给执行器,车辆再去读取、解析并执行这些指令。

目标是把具体的开发细节抽象为描述性的信息。从用户的角度看,他们只需要给出描述性的输入,就像跟人交流一样。本质上,控制与感知任务被隐藏起来,任务需求被共享并由系统执行,而参数是完全可调的。

但另一个挑战是,哪怕写脚本定义也很繁琐。我们能不能把它做得像编辑游戏地图一样直观?比如导入一张城市地图,标出起点和终点,系统自动为车辆生成路线——这个过程就简单多了。目标是不断降低门槛,让更多人参与并使用这个开放的工具。如果在地图上标路线可以取代写脚本,那么不懂编程的用户也能操作系统,复杂度进一步下降。一项技术要走向成熟并被广泛采用,就必须变得更好用——被简化的东西才会成为主流。我们做开发的终极目标,就是最大化的可及性。而现在,大模型正在让每个人都能成为设计者。

Echo Tang: 车辆能否通过采集传感器数据、对周围环境建模,来自主构建地图?

岑明: 这需要更高层次的规划。本质上,关键是要有一张地图。每辆车按照规划好的路线执行分配的任务,这就不可避免地需要云端的协调与管理。


3. 功能型自动驾驶车辆打破自动化孤岛,解决物流“最后一公里”

Echo Tang: 重庆在这个方向上可能已有不少讨论和研究,这座城市的机器人与智能网联汽车产业在国内位居前列。您提到的功能型自动驾驶车辆,是不是在产业园区里频繁测试?

岑明: 我们一直在做重卡和商用车,而不只是简单的出行方案。我们的目标不是完全取代人力,而是减轻工作量、释放人力。我们此前在重庆承担过一个专用自动驾驶车辆项目,聚焦重型卡车。由于卡车不允许在城市道路上运行,它们主要在产业园区内行驶,最终演变为物流运输车之类的功能型自动驾驶车辆。它们的核心使命,是解决物流的“最后一公里”难题

智能制造要求生产车间实现零库存:客户订单必须快速交付,成品必须立即转运,从而免去中间仓储。通过部署功能型自动驾驶车辆,我们把仓储管理纳入物流流程,为物流方提供点到点的短途物流服务,完成运输的最后一程。

仓库和车间各自已经实现了自动化,但两者之间的衔接仍然依赖人工驾驶的车辆,形成了效率的洼地。功能型自动驾驶车辆填补了这两座自动化“孤岛”之间的空隙。当后台 ERP 系统下单,生产调度系统发出指令,车辆调度系统就启动相应的运输任务。过去司机要人工驾驶车辆、携带纸质单据,现在理论上已经不需要司机,尽管仍会有安全员待命,以便在紧急情况下介入。

经过几年的运行,我们的合作方反馈说,安全员可能几个月才需要介入一次。这印证了功能型自动驾驶车辆的核心价值——大幅减少劳动密集型的工作。更重要的是,它们成功打破了仓库与生产车间之间的自动化壁垒,把两个原本孤立的自动化系统整合进一张更大、更高效的自动化网络中,实现了从仓储到制造的无缝协同。

Echo Tang: 说到自动化,很多人第一反应是担心岗位被取代。最近美国就因为担忧自动化导致失业而爆发了大规模的港口工人罢工。您在推进自动化时如何看待这个问题?

岑明: 自动驾驶的趋势不可阻挡。我们今天生活的改善,正是一系列技术革命的结果。就个体而言,人们应该主动适应这些变化,拥抱自动化。


4. 在自动驾驶中平衡安全与成本

Echo Tang: 能分享一些自动驾驶在产业园区中的真实应用吗?

岑明: 起初,我们的项目是为了让学生获得技术经验。随着机会出现,我们扩大了研究范围,最终启动了自动驾驶重卡项目。

当时我们有信心应对园区里那些热门任务,比如巡逻和物料运输。但有一个提案给我留下了很深的印象——某个园区想引入一辆自动驾驶车来吸引游客。尽管有人极力推荐,我还是有所保留。

在工厂环境里,员工是受过训练、遵守规则的专业人员。但在园区里情况完全不同——游客很多,其中还有好奇心毫无边界的孩子。我们花了很大力气与厂商沟通,增加传感器数量。试运行期间,孩子们常常围到车旁,有的甚至伸手去摸,这更印证了增配传感器的必要性。

自动驾驶车辆的安全技术本身不是问题,真正的问题在于厂商压缩传感器成本。很多事故的发生,是因为厂商为了降低开支而过度削减传感器配置。如果传感器数量增加两倍,我相信事故风险会显著下降。随着技术进步,驾驶风险已经有所缓解;但如果厂商把安全置于成本之上,车辆在理论上是可以做到近乎完全安全的。

Echo Tang: 关于功能型自动驾驶车辆的安全,哪些问题可以解决?我们又应该重点关注哪些关键问题?

岑明: 安全是个宽泛的话题,多数人首先想到的是网络安全。比如,如果自动驾驶系统接管了车辆,人们会担心系统故障把车开进危险区域——比如冲进河里——而驾驶员无从干预。这种担忧源于对黑客攻击或恶意攻击的顾虑,属于网络安全的范畴。

另一大关注点是功能安全,它确保系统运行时不出现故障或崩溃。功能安全分为不同等级,包括冗余设计和失效安全机制。关键在于避免系统彻底失效,让性能逐步降级而不是骤然崩溃。

功能安全又可细分为软件安全和硬件安全。硬件安全关注电路可靠性,比如即使某个软件模块崩溃、停止响应,系统仍能继续运行。系统能否检测到这类故障?这就要靠软件功能与控制机制上的冗余。

此外,当多个系统节点通信时,系统应能检测某个模块是否在给定时间内停止响应。届时它必须决定如何处理——是通知其他节点、减速、停止作业,还是发出告警请求人工介入。这些都是真实应用中至关重要的安全策略。

Echo Tang: 您在低成本开发方面做了大量研究。能否详细谈谈如何在降低成本的同时提升效率?

岑明: 开发所有相关软件的代价极其高昂。完成重卡项目之后,我们开始寻找在后续项目中复用既有成果的方法。关键在于识别可复用的组件,并让它们的集成效率最大化。

我们采用了任务建模的方法:把项目拆分为更小的模块,抽取不同车型之间的共性功能,并对通用特性进行标准化。那些经过反复测试、被证明可靠的组件可以直接复用,大幅减少重复编码。

一个设计良好的架构,对提升效率、降低成本、增强可靠性都至关重要。架构一旦确立,无论是学生还是开发者,都可以专注于自己负责的模块,而不必深入理解整个系统。

Echo Tang: 您指的是模块化的开发方式?

岑明: 正是——建立一套标准化的框架,让开发者可以专注于各自的具体任务。人的注意力是有限的,在既定框架内专注于自己那一块结构,是最高效的开发方式。GOSIM 关注的是开发,而在开发之中,最优先的就是效率、可靠性和长期的可持续性。


5. 开源与协同智能驱动创新

Echo Tang: 您目前的研究是开源的吗?

岑明: 目前我们的工作还处于早期阶段,但我们计划未来开源。如果我们的研究能得到认可、被广泛采用,甚至激发他人进一步探索,那将非常有意义。这也是我们需要拥抱开放的原因——把工具开源出去,就能吸引更多支持,在更大范围内加速技术进步。

开源的优势在于它能让更多人为一个项目做贡献。我们的开发中可能存在自己没有注意到的问题,但一旦开源,其他开发者就能帮助发现并改进这些地方。此外,开源也孕育创新,让新的想法得以涌现并融入项目。

个人的能力是有限的,但通过开源,我们可以把更多人纳入进来,共同推进项目、扩大它的影响。这不仅有利于技术本身,也会对更广泛的社区和行业产生积极作用。

Echo Tang: 对于今天从事自动化与机器人领域的学生和开发者,您认为他们需要哪些核心能力才能在当下的技术环境中立足?

岑明: 开源社区本身已经提供了极好的学习环境。以 CSDN 这样的平台为例——我刚做程序员的时候,经常遇到不熟悉的问题,在 CSDN 上搜索就能接触到有经验的从业者的见解。后来又出现了各种开发者社区,提供类似的问答平台。编程社区里满是热情而乐于分享的人。

Echo Tang: 随着 AI 大模型的兴起,很多人现在直接向它们寻求答案。您怎么看这种转变对开发者工作方式的影响?

岑明: AI 给出的答案未必总是正确,所以用户需要具备一定的批判性思维去评估这些回答。从某种意义上说,AI 可以与 CSDN 这样的开发者社区互补。理想情况下,我们可以走向一种协同智能的模式:AI 提供初步的见解,社区讨论帮助打磨和验证这些想法。

Echo Tang: 感谢岑教授带来这场富有洞见的对谈!今天的讨论就到这里,我们下期再见!


作者 | Harper Zhuo
采访 | 唐小引 Echo Tang
编辑 | 何苗
出品 | GOSIM 开源创新汇