关于ZAKER Skills 合作
雷锋网 9小时前

TUM 黎子玥:模型这么大这么强,为什么还是「上不了路」?

学术数据和真实数据完全是两回事;可解释性成落地"生死线"。

作者丨幸丽娟

编辑丨岑 峰

三年前,正值大模型爆发之年,麦肯锡就曾对全球交通与工业领域的从业者做了一项调研,问题很朴素:距离真正的智能化,还有多远?

答案出乎意料地悲观:还要10到20年。

而把时间线拉到现在,模型越来越大、智能体越来越多、时空数据挖掘的论文层出不穷。

现实依旧是,全球没有一座城市长期部署了基于强化学习的交通信号控制系统。那些在顶会上"超越所有SOTA"的预测模型,真正到了城市交通部门手里,他们的答案往往是:"这个方案,我不敢放手用。"

问题的症结在哪里?

在刚刚结束的 IJCAI 2026 Early Career Spotlight(早期职业焦点)演讲中,慕尼黑工业大学 (TUM) W2 教授黎子玥(Ziyue Li)给出了他的答案:

第一,学术研究长期停留在"干净数据"的舒适区,而公共部门面对的,永远是不完整、不规整、不可控的真实数据;

第二,可解释性不是论文里的加分项,而是从实验室走向城市落地的"生死线"。

黎子玥的履历横跨学界与工业界:香港科技大学工业工程与决策分析系博士,现任慕尼黑工业大学W2教授,此前任科隆大学W1教授;曾在斯图加特贝尔实验室、香港地铁、商汤科技辗转于科研与产品之间。他既在KDD、IJCAI、ICLR、NeurIPS等顶会发表大量研究成果,也亲手将研究推向真实部署,亲历过从论文到产品的每一道坎。

他在演讲中,进一步用自己在学界与工业界之间摸爬滚打的经历,凝练出一个他称之为"PDE三角"的框架——感知(Perception)、决策(Decision)、解释性(Explanation),试图弥合学术研究与公共部门落地之间的那道鸿沟。

同时,他还描绘了一条从人工主导走向自动化的技术路径:描述性分析(发生了什么)到诊断性分析(为什么发生),再到预测性分析(将要发生什么),最终抵达规范性分析(应该怎么做)。

这条技术路径,也是一份写给整个AI研究社区的"诊断"指南:当你的模型在基准测试上排名第一,但城市管理者依然不敢按下那个开关时,问题不全在城市管理者身上,也不全在研究社区身上,而在于两者之间缺乏有效的转化机制。

以下是黎子玥教授的演讲分享,AI科技评论根据其演讲内容进行了不改原意的编辑:

TrafficPDE: A Guidebook to Deployable AI-Driven Transportation Systems——Through the Perception-Decision-Explanation Triangle(TrafficPDE:可部署AI驱动交通系统指南——基于感知-决策-解释性"三角"框架)

01

从"DB "说起:一个研究者的困惑

大家可以看到这个DB的logo吗?在座的各位,有没有人跟德铁(DB)有过struggle的?

所以我觉得这可以成为一个特别好的起点,来聊聊我们如何用机器学习来做这件事,以及结合我过去四到六年在交通领域摸爬滚打的经历,谈一谈我们到底如何为公共部门做出真正有用的研究。

我们启动了一个项目,叫 "DB Delays" (列车延误系统),并且我们做了一个开源平台。你基本上随便输入一个城市,比如柏林,点进去,就能看到所有列车实时的运行轨迹。你点一下那个按钮,从ICE到区域列车(RE),所有车在哪儿、怎么在动,一目了然。

更关键的是,我们一旦知道了过去发生了什么,就能确切地知道这趟车到底晚点了多久。在此基础上,我们就能理解、甚至预测未来可能发生什么。在不同粒度上——从一个州到另一个州,到不同城市,甚至精确到你平时常坐的那趟车。我自己就经常坐火车,我打开这个界面,就能知道:哎,我眼前这趟车,它真的晚点了。

这是我心目中一个真正由AI驱动、数据驱动的智慧城市和智慧交通应该有的样子——一切运转丝滑。但现实是,我们仍然需要一本"指南手册"(Guidebook)来弥合这个差距。我等会儿会重点讲这个差距到底是什么。

我们做了那么多研究,但很多时候,那些花哨的时空数据、智慧交通论文,并没有真正惠及公共部门。

所以我就在想,我在这次"早期职业聚焦"演讲,到底能讲什么值得说的贡献点?我试着从我过去这四到六年在工业界和学界的经验,总结出一点有用的东西。于是我想到了三个字母,不是偏微分方程那个PDE,而是感知(Perception) 决策(Decision)和解释性(Explanation)。这三个模块,或许能凑成一本指南手册。

2023年,麦肯锡曾经做过一个调研,问了不同领域,特别是工业界和交通部门的人:距离真正实现智能化还有多远?

答案是:还要10到20年。

我当时就纳闷了:我们现在有那么多智能体(agentic),模型一个比一个大、一个比一个强,为什么在这个特定应用领域,还得耗这么久?

02

干净数据 vs. 脏数据:

学术界的"舒适区"与真实世界的落差

先看看数据是怎么来的。我先给大家看一个"干净"的版本,稍后我会给大家看一个"脏"的版本。

干净版本就是香港地铁的数据。我们跟香港地铁合作了很多年。香港地铁有一百多个站,每个人在自动售检票系统(AFC)上进站刷一次、出站刷一次。数据库里记录的就是:多少人进来了,多少人出去了。

所以你能拿到每个站点、不同时段的漂亮数据。你能看到特别清晰的周规律——工作日和周末截然不同。再看不同站点,你还能发现很好的空间模式:有些站是早高峰一头独大,有些是晚高峰独大,还有一些是全天比较均衡。

这就是我们领域里常说的"时空机器学习"。这些词很时髦,其实就是怎么把空间和时间上的这种相关性,变成数学公式或者网络结构。

顺便插一句,为什么有些站是早高峰、有些是晚高峰?原因其实就取决于它们到底在城市哪个位置。这个我后面会再提到。

以上说的是数据是怎么来的。那一篇典型的时空交通预测论文长什么样呢?

如 PPT 所示,我们可以看到很漂亮的pipeline,把各种模块往上拼。然后你觉得不够复杂?好,加一层。还不够?再加一层。还不够?继续加。

这基本上就是我们每次审稿时都在看的东西。说真的,我已经看腻了。

模型这边是这样,数据那边呢?没错,右边这个数据图标,就来自我自己的论文,但我今天特意把它拿出来,就是想提出一些批评。你看,我们比了20个数据集、30个模型,不管怎么比,我们的永远是最好的。今天比这个好,明天比那个好。

所以有一天我就在想:如果咱们预测得已经这么准了,为什么路上的问题还是没解决? 这肯定哪儿不对劲。

那调研到底说了什么?差距到底在哪儿?为什么还得10到20年?

他们列了几个关键原因:基础设施准备度、互操作性、数据整合……你仔细看,大量问题都指向数据。再细看数据相关的关键词——可扩展性、实时性、异构数据源、数据质量。

所以我们现在要做的,就是实实在在地去学习怎么搞定这些"脏"数据

03

"PDE三角"框架:

感知、决策、解释性三者平衡

我先简单说一下我的背景,这样大家就知道我为什么关心这些问题。

学术方面,我2021年在香港科技大学工业工程与决策分析系拿到博士学位;之后在亚利桑那州立大学做过访问;2022到2025年在科隆大学做W1教授,2025年起在慕尼黑工业大学做W2教授。

产业方面,我2019年在斯图加特的贝尔实验室做过研究Intern;2021年跟香港地铁校企合作研究的项目经理;2022年在商汤科技带过一个小十人团队做智慧城市研发和落地。

所以我既懂真实的产业问题,也知道什么是有影响力的、有意义的研究问题。

那怎么把这些年的经验总结成一个框架,来帮助智能交通的AI研究员,怎么尽可能的让自己的研究能带来真正的real-world impact,而非仅仅是去overfit开源的数据集?

我提出了一个叫"PDE三角"的框架——P是Perception(感知),D是Decision(决策),E是Explanation(解释性)

为什么放这张图?因为人体比例,讲究的是和谐与平衡。我们做交通系统也一样——感知、决策、解释性,三者必须平衡,缺一个都不行。

因为交通是高风险的场景:信号灯控制关系到安全,应急救援关系到生命。你不能出一个黑箱模型说"就这么办,别问为什么"——官员不买账,市民不买账,真正用的人更不买账。

▎感知(Perception):模型训练和数据

感知层面,首先我们要让模型在训练阶段就看到所有可能的场景。

因为我们现在做交通预测,经常犯一个错误:用历史数据训练模型,但历史数据里晴天多、雨天少、突发情况更少。模型上线一遇到暴雨、一遇到事故,马上就傻了。

所以我们做的第一件事,就是把训练数据的覆盖面做到极致——所有长尾案例,都得让模型见过。

其次,模型还得能适应不同类型的交通数据。

我们做了很多工作让模型能适配不同类型的交通数据——地铁、道路、不同城市的数据都能用。目标就是做出可泛化、鲁棒的时空数据模型。

那我们的方法到底行不行?在各类交通数据上,效果确实还不错。地铁的、道路的、不同城市的,都能跑通。

然而现实往往更残酷,很多时候我们根本没有足够的数据。

举个例子,我们合作的一个城市有超过三千万人口,但只在120个路口部署了传感器。大部分地方没有任何数据。

那怎么办?只有20%的传感器,怎么推断剩下80%的数据?

我们用了两种预训练策略。一种是做"减法"——训练时把一些节点mask掉,让模型去恢复它们。

另一种是做"加法"——加入虚拟节点,基于伪标签去推断。

▎决策(Decision):RL信号灯控制的三重困境

感知做完了,怎么转化成决策?

直观地想,如果某个路口车多了,你应该怎么做?对,调整信号灯。

我们过去几年在强化学习信号灯控制上做了不少尝试。

一开始我们想的是:在一个城市训好的模型,换个城市还能不能用?

比如在柏林训的,拿到不莱梅去用。大家知道,柏林和不莱梅的交通模式完全不一样——路网结构不同,车流量不同,甚至开车习惯都不同。你换个城市就得重新训,那谁还用啊?

所以我们在GESA里面做的是场景无关的强化学习,不管什么城市、什么路网结构,模型都能直接上手。

X-Light更进一步,用"Transformer on Transformer"的结构做元多智能体,说白了就是学会"怎么学习",跨城市迁移的效果更好。这篇还被IJCAI选为Highlight Paper。

DuaLight的想法是:每个城市有自己独特的特点,但不同城市之间也有共性的东西。那我们就把"场景特定的知识"和"场景共享的知识"分开学,两个都要,互相补充。

好,跨城市的问题在解决。但RL做信号控制,还有三个更实际的问题。

第一个:大规模城市怎么合作?

你想象一下,一个城市几百个路口,每个路口都是一个独立的智能体。它们之间怎么配合?是不是所有路口都应该互相通信?显然不是——离得远的路口互相传消息,纯属浪费算力。

所以CoSLight里我们做的是:把"选谁当合作伙伴"和"怎么一起做决策"这两件事放在一起优化。这两个问题是耦合的——你跟谁合作,会影响你怎么做决策;你怎么做决策,反过来又影响你该跟谁合作。分开做效果不好,要联合优化。

第二个问题:来了新场景,能不能快速适应?

城市交通是动态变化的——今天修路、明天封桥、后天有个马拉松。模型训好了,但场景变了,怎么办?从头再训一遍?太慢了,不现实。

FElight解决的就是快速适应新环境的问题。给定一个新的交通场景,它不需要重新训练,而是快速调整策略,在极少的交互内适应新场景。这在实际部署中很关键——城市管理者不可能等你的模型训好了再开管控。

第三个问题更接地气:工程师敢不敢用?

我们发论文的时候总说"超越了所有SOTA",但到了真正要部署的时候,工程师说——你这个策略我不敢用。

为什么?因为RL有时候会做一些"反直觉"的事情。绿灯本来该30秒,它突然给35秒,过一会儿又变成28秒。你说这能提高通行效率,但交通工程师看不懂啊。他们习惯了"绿波"那种有规律、可解释的控制逻辑。

所以GuideLight里我们做的是——加一些"工业界的引导"。不是让RL完全自由发挥,而是约束它的行为,让它更像工程师能接受的那种方案。牺牲一点点性能,换来了可接受度和可落地性。

但即便我们做了这么多工作,我必须说一个不太乐观的事实:目前全世界还没有任何一个城市,长期部署了基于强化学习的信号灯控制系统。

具体而言,存在三个障碍:

第一,解释性。运营人员需要理解信号灯在做什么,"绿波"策略是可解释的,但RL策略不是。你让一个交通工程师去解释神经网络为什么这么决策,他做不到。

第二,仿真到现实的鸿沟。RL信号灯控制通常用非定周期的控制方式,但大多数城市不支持这种模式,而现实部署更偏向SCATS那种定周期控制。

第三,更长远来看,如果车辆本身就可以作为一个互联车队协同工作,我们真的还需要一个集中式的控制器吗?

▎解释性(Explanation):因果学习的应用与边界

谈到解释性,先看我们在因果学习的研究成果。

因果结构学习本质上是NP-hard的组合优化问题:节点数越多,可能的图结构呈指数级增长。传统上用各种启发式搜索——局部搜索、爬山法……但节点超过一百个就很难搞了。

所以我们用连续优化的方法,把DAG学习转化成一个可微的问题。

在交通领域有哪些具体应用呢?主要包括:交通事故分析、交通拥堵分析、德国列车延误根因分析、充电站选址、电动出行枢纽选址等。

但从行业视角来看,因果学习方法的最大挑战是:学出来的DAG没有"真实值"(Ground Truth)可对照。

什么意思?我解释一下。

我们在做监督学习的时候,比如预测交通流量——你有历史数据,有真实发生的流量值,那个值就是Ground Truth。模型预测的对不对,一比就知道,清清楚楚。

但因果不一样。

你学出来一个因果图,说"A导致B导致C"。但这个结论到底对不对?没有人能给你一个标准答案。因为你没法做一个平行宇宙的对照实验——同一条路,同一个时间,一个版本有公交专用道,另一个版本没有,然后看结果有什么不同。现实世界只能发生一次。

所以我们能尽力做到的,就是把发现的因果结构呈现给城市规划者和政府官员,把最终决策权留给他们。我们的角色是决策辅助者,不是决策者。

具体是怎么做的呢?把交通数据作为输入,去构建因果图。就是把我们已有的各种数据——流量、速度、占有率、天气、时间、路段属性、事故记录——全部喂进去,让因果发现算法自动去"找"这些变量之间的结构关系,画出一张有向无环图。

因此,基于我所有的研究成果,我总结出了三条"黄金法则",也就是一个可部署的机器学习模型,在智能交通系统中的"黄金"检查清单:

第一,感知:模型能不能安全地处理长尾案例?这个问题来源自我们交通部门的真实客户。

第二,决策:模型能不能从部署的第一天就开始运行?这是来自我们的产品经理"Anna"问的问题。

第三,解释性:模型能不能向有交通或城市规划背景的人进行自我解释?这是来自产品经理"George"问的问题。

04

四根"分析支柱",

检验何为可落地的研究

我们的研究愿景很简单——做有影响力、可落地的研究,把影响带到真实生活中去。

不是追求发了多少篇论文,而是回答这些实际问题:哪个路口在堵车?堵了多久?为什么堵?下一个堵点在哪?

所以,当交通数据在变得真正ready 的过程中,我们能做什么?

我也总结了一个四根"分析支柱"的框架:

第一个,描述性分析——What happened?就是告诉你过去发生了什么。昨天早高峰,哪个路口堵了?堵了多长时间?

这一步最基础,但大量依赖人工输入——你得靠人去查数据、看报表、画图表,才能把事实搞清楚。

第二个,诊断性分析——Why did it happen?光知道"堵了"不够,你得知道为什么堵。是因为下雨?是因为事故?还是因为那条路本身就设计不合理?

到这一步,机器开始介入了。因果学习帮你去拆解原因,但最后还是得靠人来判断哪个原因才是真正值得关注的。

第三个,预测性分析——What will happen?知道了过去、知道了原因,那你能不能告诉我接下来会发生什么?二十分钟后那个路口会不会堵?我该不该换条路走?

到这一步,模型就可以独立跑了。你训练好模型,它自己输出预测结果,人只需要读最后的报告就行。

第四个,规范性分析——What should I do?最难的,但最有价值的。不光告诉你"会堵",还告诉你该怎么做——信号灯该怎么调?车辆该怎么引导?应急救援该往哪派?

这一步,几乎可以全自动。模型做优化、做决策推荐,甚至直接输出控制指令,人的介入降到最低。

而这些决策、行动也可以反馈给数据端,形成一个良性闭环。

总体而言,从描述、诊断到预测,再到指导,这是一个从人工主导逐步走向自动化的过程。

对应的,我们也有一些工作成果,比如,关于数据缺失和未知位置推断的研究,发在AISTATS和NeurIPS;交通因果学习,发在KDD、ICLR;轨迹预测、异常检测、流量预测、信号控制等,也在KDD、IJCAI 等各个领域的顶会上进行了发表。雷峰网雷峰网雷峰网

05

Q&A 现场问答

▎Q1(一位法国航空排程专家):在航空业,很多时候地面导致的延误根本不可知,所以我们在数据源头都不知道问题出在哪,那该怎么办?

黎子玥:在公共领域,很多因素我们不可知,也真的无力能做什么,但至少我们可以把数据民主化——把相关的数据展示给大众,这个动作本身就能带来 impact。

▎Q2(一位来自范德堡大学的教授):哪些智慧交通的 sector 能更快地实现智能化?

黎子玥: 我的观察是,历史资产是一把双刃剑,blessing and curse。越是传统的交通方式,比如铁路,它的历史资产太厚重了,AI化的改造成本更高。新兴的出行方式,比如 e-scooter、无人机、自动驾驶车队等,反而是最快能迭代和智能化的。

IJCAI 2026 要来了,你还在单打独斗?

为了方便大家抱团交流、互通会议消息,我们专门建了IJCAI 2026 参会群!进群你会解锁这些「福利」?

会议情报站:投稿 DDL、格式规范、评审进度……关键节点第一时间送达,再也不怕错过 deadline,投稿准备稳稳的。

同行茶话会:天南海北的同行都在群里,聊心得、碰思路、攒人脉,科研路上我们同行。

前沿补给站:最新研究成果、热点方向实时同步,结合会议主题帮你捋清投稿脉络,给论文灵感加满油。

现场后援团:(会议期间专属开启):到了会场也不用慌——

路线导航:场馆分布、报告厅怎么走,群里随时问;

议题共读:热门 session、Keynote 现场探讨,错过也能追;

Poster 汇编:现场海报精华整理,一键收藏不遗漏;

约局广场:约饭局、采访局、交流局……想唠嗑、想合作、想面基,群里发起就成。

? 进群传送门:扫码进群或添加微信Qvv0909777,备注:IJCAI+ 单位/学校+姓名+方向

搞科研/搞技术,信息差很重要。

来,一起快人一步!

上车,带你看遍全球 AI 顶会精华

可独家畅览:

专家演讲PPT

大会报告全文

热门论文解读

学术新星访谈

扫描上方二维码

或点击「阅读原文」关注专区。

相关阅读

最新评论

没有更多评论了
雷峰网

雷峰网

读懂智能&未来

订阅

觉得文章不错,微信扫描分享好友

扫码分享

企业资讯

查看更多内容