高德全模态出行智能体2.0
人工智能正在加速指数级跃迁。模型从理解语言走向理解世界,Agent从回答问题到自主规划和完成任务。越来越多的领域里,人与AI的協作方式被重写:人不再需要把目标拆解成一连串标准指令,而是直接表达意图,把复杂交给Agent。
这种革命也正在出行场景里发生。与屏幕和桌面上的任务不同,出行始终处在一个持续变化的真实世界中:人不断移动,位置、路线、路况与沿途环境每一刻都在更新;用户既需要即时回答,也会把跨越数小时、数十公里的任务托付给Agent,Agent不能只计算一条路线,还要实时理解用户身处何地、正在经历什么,以及接下来真正需要完成什么。
高德全模态出行智能体为此而来。它通过位置、语音和视觉实时感知用户所处的时空环境:位置提供此刻的空间坐标、行程与路线进度,语音承接自然连续的表达,视觉让智能体看到用户眼前的真实世界。三种感知与高德的地图、路网、实时交通和地点服务深度融合,让出行中的每一个关键时刻,都成为可以被理解、被响应、被主动服务的“智能时刻”。
2026年8月下旬起,高德开始在全国各城市陆续推送全模态出行智能体2.0版本,正式开启“导航Live模式”:导航不再只是用户发出指令后给出一次反馈,而是与用户共同处在旅程之中,持续感知、实时理解,并在变化中把事情办成。

一次唤醒,开启沉浸交互
驾车时,人很少会用一组规整、彼此独立的指令与导航交流。你可能一边听着广播,一边问“前面有没有咖啡店”;得到推荐后,紧接着追问“第二家呢”“停车方便吗”;话说到一半,导航又需要插入一句“前方路口左转”。同行人可能正在聊天,开窗后风噪突然增大,驶入隧道后声音和网络环境也随之改变。

图中这一段行中交流,同时包含了多种状态:用户向智能体发起对话;智能体讲故事时,广播在后台播放;用户打断智能体开启新话题;用户转而询问同行人;用户重新回到原话题,智能体继续回答;高优先级导航播报到来,智能体主动暂停,并在播报完成后的安全时机续接此前未说完的内容。
许多AI产品面对的是相对安静、说话人与设备距离稳定的室内环境。驾车场景则是一套持续变化的开放声场,至少要同时解决四类挑战:
1复杂声学环境。 发动机、胎噪、风噪随车速变化;音乐、广播和导航自身的声音持续存在;开窗、隧道、路面变化又会改变回声与信噪比。
2多人、多声源混杂。 用户可能在和智能体说话,也可能只是在与同行人交谈;广播里的人声、同行人的插话,都不应被轻易误判为指令。
3出行领域的超大识别空间。 用户会使用普通话和各类方言,还会说出海量地点、道路、商户和别名。亿级地点名称中,大量词汇低频、相似且随位置变化,通用语音模型很难仅靠固定词表稳定识别。
4导航与对话共享时间线。 交互不是简单的“用户输入—Agent输出”。导航播报由时间、位置和路线进度触发,可能随时插入对话;系统必须决定何时暂停、何时让路、播报后是否续接,以及用户在播报过程中插话时该响应谁。
双工语音一直是学术界和工业界研究的热点。真正困难的不只是让用户能够打断智能体,还要同时保证两件事:准确判断对话时机,以及Agent不因语音模态的引入而降智。在高德导航这个亿级用户的存量场景里,这两项挑战又被进一步放大了。最终我们通过判断,选择了由Turn判定模块驱动的半双工方案:将复杂的声学环境挑战交给自研的Pilot-Turn模型,同时让Agent专注于语义理解、推理和回答,避免对话时机判断过度侵入Agent主体。
Pilot-Turn负责实时识别连续语音中输入的潜在状态,包括accept、reject、incomplete、complete和backchannel。在实践中,我们发现对用户声音和各种背景声音(如车载广播、音乐、视频声,甚至AEC系统的漏回声)的区分是真实场景中最突出的症结,为此特别增强了车载和室外场景背景声的判断能力,通过accept/reject来做区分,确保在各类场景下的对话不被错误打断干扰。同时以complete/incomplete保证输入的语义完整性,使用户在噪声、广播和多人交谈环境下仍能自然停顿、插话和追问。此外,为了应对亿万级的地理热词,自研的PilotASR支持对海量热词的实时检索和动态注入,不只是加载一张固定词表,而是结合用户当前位置、路线、目的地和对话历史,动态提高相关地点、道路与商户名称的辨识能力。同时在方言、上下文等多个维度指标达到了SOTA水平。
理解此时此地,
扛得住复杂时空变化的执行能力
自然的交流解决了“怎么说”,但要在真实道路上把事情办成,智能体还必须理解一个不断变化的世界。
汽车每秒都在向前移动:几分钟前还算顺路的地点,可能已经被驶过;用户会临时增加条件,候选地点可能关闭或不可达,工具可能返回空结果,路线和途经点也会因为实时路况发生变化。与此同时,有些任务并不在用户说完一句话后立即结束——“下个服务区前1公里提醒我”“每隔两个半小时提醒我休息”“路过有故事的地方时讲给我听”,都需要智能体在接下来的整段旅程中持续记住,并在正确的时间和地点执行。
因此,驾车Agent不能只完成一次问答。它既要根据此刻的位置、路线和用户约束找到真正可执行的结果,也要在需求与外部环境改变后重新规划,还要让一个任务跨越数分钟、数小时甚至多段行程持续存在。围绕这些挑战,全模态出行智能体2.0构建了三项关键能力。
找得准:精准构造“可执行候选”
面对“终点附近找一家还在营业、人均300左右、评分高、不要绕路的淮扬菜”,普通搜索只需要找出相关餐厅,驾车Agent却必须同时回答:以哪里为搜索中心、哪些条件必须满足、哪些只是偏好、到达时是否仍在营业,以及驶入这个地点需要付出多少绕行代价。
高德构建了POI-Explore多维约束求解能力,将用户的一句话拆解为时间、空间和语义约束,支持6类筛选——距离、品类、品牌、评分、营业状态、价格,以及5类排序——距离、价格、评分、人气和综合最优。对于“顺路”这样的要求,系统不依赖模型猜测,而是结合当前路线、预估到达用时和候选点的绕行距离进行判断。驾车场景还增加了“可达性”这一层约束:同一个直线距离很近的地点,可能因为路网方向、禁行规则、出入口位置或停车条件而无法方便到达。因此,POI-Explore输出的不是一张信息列表,而是一组可以继续算路和执行的候选:
可执行候选 = 对象匹配 ∧ 硬条件有证据 ∧ 搜索中心正确 ∧ 驾车代价可解释 ∧ 未命中历史排除集
办得成:通过反事实训练应对真实世界的变化
真实行车不会始终沿着理想路径发展。用户可能中途修改或放弃条件,目标地点可能关闭、不可达或被用户否决,工具可能超时或返回空结果,路线重算也会改变途经点状态。一个只在“一切顺利”时有效的Agent,在真实道路上并不足以被托付。
为此,高德在ReAct推理强化中引入反事实推断模型,让它同时担任“干预者”和“裁判员”:基于工具调用轨迹,在关键决策节点构造可观测、可验证、可恢复的变化,再检验智能体能否及时发现变化、正确诊断原因并恢复服务。
这些干预不是随机加入噪声,而是以真实工具调用轨迹为条件,覆盖四类典型变化:用户约束变化、候选点失效、工具异常,以及路线和途经点状态变化。这种方式把Agent训练从“在已有轨迹上打分”,推进到“主动在考场上出变化题”。在人工评测中,最优反事实模型的用户需求满足率达到87.0%,相比纯SFT模型提升12.1个百分点;在反事实干预评测集上,模型效果由40.7%提升至83.1%。训练目标不再只是第一次把事情做对,而是在世界改变之后仍然能把任务接回来、继续做完。
时空长程任务:把一句委托带到旅程中的正确时刻
经典Agent是请求驱动的:用户说一句,系统完成一次编排和行动,任务随即闭环。但出行中的许多委托天然跨越时间和空间。用户说完之后,智能体仍需持续感知路线进度、相对距离、到达事件和时间条件,直到任务真正完成。
全模态出行智能体2.0为此引入条件驱动的长程任务范式:
任务创建 → 条件持续监听 → 满足时主动播报 → 任务闭环或重置
系统支持五类触发条件:路线前置距离触发、地点到达触发、相对时间触发、周期重复触发和条件重复触发。它既可以承接用户主动发起的任务委托,例如“服务区前1公里提醒我”,也可以在识别到休息、补能或沿途探索需求后先向用户发起邀约,获得一次授权后在全程分点交付。
关键的工程设计,是把任务做成“一等实体”,而不是一次性定时器。任务拥有创建、更新、触发、挂起和销毁的完整生命周期,可以跨越一次甚至多次行程,也可以被Agent检索、指代、推理和改写。当用户说“去公司的路上,路过咖啡店提醒我一下”,智能体能够自动组合“沿路线POI搜索”和“地点触发型长程任务”;用户随后说“把刚才那个提醒取消”,也可以直接找到并修改此前的任务。
打开摄像头,
让智能体与你一起看世界
语音让智能体听懂用户,摄像头则让它真正进入用户眼前的世界。打开摄像头后,Agent不再只依靠位置、路线和语言理解旅程,还能持续感知前方道路、车辆、地标和行人:用户看到什么,可以直接问;道路上出现值得关注的变化,智能体也可以在适当的时机主动提醒。
这带来了两种不同于传统视觉问答的体验:一种是与智能体看着同一条路自然对话,另一种是让智能体持续观察道路,在风险出现时及时开口。
看路对话:眼前所见,随时可以问
驾车中的视觉交互,很少以“请识别这张图片”开始。用户更可能一边看路一边自然发问:“前方路况怎么样?”驶近一辆车时问“前面这是什么车?”看到沿途建筑时问“那座大楼是什么?”临近路口时,还可能问“前方红绿灯还剩多久?”
这些问题横跨道路环境、车辆细节、沿途地标和动态信号状态,却都发生在同一条不断变化的视觉流中。用户不需要停车拍照,不需要圈选目标,也不需要补充坐标;打开摄像头,看到什么,就可以直接问什么。

要实现这种体验,模型处理的不是一张目标清晰的静态图片,而是一条不断变化的开放道路视觉流。它既要理解车道、车流和道路结构,也要看清远处车标、灯组等局部细节;既要克服逆光、雨雾、玻璃反光、运动模糊和遮挡,又要把画面中的建筑、道路和信号灯与车辆此刻的位置、方向和路线对应起来。早几秒或晚几秒,眼前的答案都可能已经发生变化。为此,我们强化了两项技术能力。
全局—局部协同视觉理解。 完整道路画面作为全局分支,保留车道、道路、建筑与目标之间的空间关系;基于目标检测与区域增强的局部分支,则将用户关注的小目标重新送入模型,强化车标、灯组和车身结构等细粒度特征。两路视觉信息在同一次推理中相互补充,让Agent既知道“它在哪里”,也看清“它是什么”。在车型识别评估中,采用“原图 + 局部目标增强”后,品牌识别正确率达到 93.5%,相较仅使用原图的 87.7% 提升 5.8 个百分点;车型识别正确率达到 79.6%,相较仅使用原图的 73.1% 提升 6.5 个百分点。
视觉—地图时空锚定。 Agent将相机画面中的道路、车辆、建筑和信号灯,与当前位置、导航路线、高德道路结构、沿途地标及动态交通信息组织成统一的“此时此地”上下文。视觉感知负责找到用户正在看的目标,高德时空信息进一步确认它是什么、在哪里,以及当前处于什么状态。由此,“前面的大楼”和“前方红绿灯”不再只是画面中的像素,而是能够被理解、被回答的真实道路对象。
从一次识别到一路理解,关键不是让用户学会更标准的视觉指令,而是让 Agent 同时具备看清细节与理解时空的能力。路况、车辆、地标、信号灯,眼前所见都能直接问;视觉理解也由一次图片问答,真正成为导航过程中的自然交互方式。
看路预警:该提醒时及时开口,不该提醒时保持安静
驾车时,真正需要提醒的风险,往往不会等用户先发现、再开口询问。驶近路口时,一辆电动车可能突然从建筑盲区穿出;斑马线前,行人可能被前车或路边设施短暂遮挡;跟随大车转弯时,侧前方视野会被整块切断;进入停车场后,行人又可能从车位间突然出现。驾驶者既要观察道路、听取导航,也要处理车辆操控,很难始终把每一个潜在风险都看在眼里。
主动安全感知一直是自动驾驶和机器人领域的重要方向。真正困难的并不只是把目标检测出来,而是把连续视觉证据、地图道路关系和播报时机连成一个闭环:既要尽早发现值得关注的变化,也要让 Agent 对自己的每一次开口保持克制。
为此,我们采用由时空风险推理驱动的主动播报技术。系统不是逐帧孤立地描述画面,而是在连续视频中聚合目标、运动和遮挡变化,并依托高德道路、位置、路线与实时视觉等时空多模态数据,判断候选风险是否位于本车相关区域、是否正在接近、是否会影响当前驾驶。在风险被识别后,决策层还会结合风险紧迫度、当前导航状态与历史提醒进行门控:证据持续增强时及时开口;风险尚不明确时保持观察;同一事件已经播报或与本车无关时主动抑制。这样,感知结果不再直接等同于一次播报,而是经过“发现—理解—决策—表达”的完整链路,最终落到一句简洁、可执行的提醒上。
看路对话解决的是“用户看到了什么,能不能马上问”;看路预警解决的则是“用户还没来得及问,智能体能不能在必要时先看见、先理解、再适时开口”。两种体验共同让摄像头从一次性的图像输入,变成贯穿导航过程的实时视觉感知通道。
从博物馆到街巷,
步行导航Live也在持续进化
从车上下来,旅程并没有结束。导航Live也同步升级了博物馆、美食等特色步行场景。
博物馆:从”到了故宫”到”看懂太和殿的第 11 只脊兽”
传统景区导览的链路是”扫码—打开小程序—在列表里找—点开听”。导航Live把它压成了零步骤:游客走到午门,抬起手机摄像头扫一眼,视觉模型完成位置自定位,AI 主动开口——”我们来到故宫博物院了,六百年紫禁城正在恭候”,随后一条 1.8公里 / 90分钟 / 6个节点的中轴路线秒级生成。
行进中,导航与讲解合成了一件事,提示”180 米后向北直行 太和殿”,对话卡同步推送讲解开场,途经武英殿、文华殿时主动递上彩蛋——不需要在地图、讲解 App、攻略之间来回切换。真正的变化发生在你举起摄像头的那一刻。站在太和殿前,视觉模型实时识别建筑并切换成现场讲解员:”屋顶的 11 只脊兽全国仅此一处——龙、凤、狮、天马……加上最前面的骑凤仙人,试着数数看?”进入殿内抬头看屋顶,鸱吻、斗拱被即时标注为”镇火神兽””古建之骨”;走进珍宝馆,讲解颗粒度进一步下沉到”件”——大禹治水图玉山、点翠嵌珠龙凤冠即时标注,并支持你反向定制:”我想先看金瓯永固杯。”
美食:从”帮你找到店”到”帮你放心吃上饭”
步行导航中,有相当比例的目的地是餐饮,大量真实需求隐藏其中。我们围绕这个缺口重做了美食场景:
•说换就换的零摩擦反悔:行进中一句”换一家”,AI 沿用你已经说过的约束(不辣、有包间、人均 150)秒级给出替代方案,不必重述一遍需求;
•顺路,而不是附近:推荐基于路线偏移计算绕行增量,给的是”顺路只多走 80 米”,而非”附近 500 米”;
•越用越懂你:多轮对话把口味、预算、场景约束沉淀成长期偏好画像,下次不必再开口;
•一点趣味:导航卡片上的消耗不是冷冰冰的”90 大卡”,而是”≈ 1 个苹果”。
持续延伸用户在真实世界的行动能力
从一次唤醒后的自然交流,到理解不断变化的路线与任务,再到看懂眼前的真实世界,导航 Live 正在让导航从一套响应指令的工具,变成真正与人同行的智能体。
路还在向前,世界也始终在变化。高德希望做的,是让 AI 始终身处其中——理解此时此地,在每一个关键时刻,把事情办成,持续延伸用户在真实世界的行动能力
本文作者@高德技术。原文链接:https://mp.weixin.qq.com/s/Gxs4F5ELRyxtBkVPSdGoeg
