Waymo联合CEO Dmitri Dolgov在YC Startup School 2026大会上系统复盘了自动驾驶近二十年的研发经验,核心围绕物理AI与数字AI的本质差异展开,提出物理AI落地需跨越四大鸿沟,并分享了七条关键技术经验。
一、物理AI与数字AI的四大鸿沟
Dolgov指出,AI从数字世界进入物理世界(如自动驾驶、机器人)时,必须摒弃“快速行动,打破常规”的互联网逻辑,转向“快速行动,安全发布”,因为物理错误无法像生成式AI那样“重新生成”。两者核心差异体现在四个维度:
1. 试错成本鸿沟:数字AI的错误仅消耗Token,物理AI的错误直接关联人命,无“撤销”按钮。
2. 实时延迟鸿沟:数字AI可容忍数秒至数分钟的响应延迟,物理AI(如高速行驶的汽车)需毫秒级决策,且计算需部署在车载终端而非云端。
3. 数据获取鸿沟:数字AI可依托互联网海量标注数据训练,物理世界缺乏天然的数字化数据集,需通过真实场景积累。
4. 安全验证鸿沟:数字AI可先发布“足够好”的版本,靠用户反馈迭代;物理AI必须在首次部署前就具备极高安全确定性,无法依赖“试错式迭代”。
二、Waymo的七条技术经验
1. 产品演示≠真实产品:可靠性需“指数级”投入
• 演示仅需实现1%的功能(Waymo首个自动驾驶演示仅用18个月),但规模化产品需解决长尾场景,可靠性每提升一个“9”(如从99%到99.9%),难度呈10倍增长。
• Waymo从演示到规模化服务耗时15年,累计完成超2亿英里自动驾驶里程,每周50万次出行,安全记录超人类驾驶员17倍。
2. 技术路线需匹配可靠性目标
• 避免“早期性能陷阱”:选择技术时需预判其长期上限,而非仅看初期提升速度(如传感器方案,弱配置会导致安全性能过早趋于平缓)。
• Waymo采用多传感器融合(摄像头+激光雷达+毫米波雷达),每种传感器对应独立编码器,融合生成统一环境视图,兼顾性能与冗余(如沙尘暴、夜间场景激光雷达可弥补摄像头缺陷)。
3. 乘技术浪潮,更要简化技术栈
• 每一波AI突破(CNN、Transformer、视觉语言模型)都需重构系统,但核心难点是将前沿研究转化为生产级部署,且不增加系统复杂性。
• Waymo推出“基础模型”策略:多模态世界动作语言模型,融合传感输入、理解物理规律、预测动作并与语言对齐,采用“快思考(毫秒级安全决策)+慢思考(语义推理)”双路径架构,统一驱动不同硬件平台(捷豹、现代等),降低车载专用层复杂度。
4. 结构增强型端到端:平衡通用性与安全性
• 纯端到端模型虽易训练,但难以满足物理AI的高可靠性需求;需引入物理规律、交通规则等结构化信息,形成“结构增强型端到端”。
• 优势:支持实时安全验证、混合训练评估(结构化空间+端到端空间)、强化学习反馈,提升Scaling能力。
5. 高保真模拟器是物理AI的“虚拟游乐场”
• 闭环模拟(而非开环被动观察)是物理AI训练与评估的核心,需构建“生成式世界模型”,同时模拟物理规律与传感数据(如Waymo结合DeepMind Genie 3生成极端场景:高速公路飞机降落、金门大桥下雪等)。
• 模拟器与基础模型共享推理能力,可生成现实中罕见的边缘场景,加速AI迭代。
6. 构建“AI Agent+模拟器+评估器”生态系统
• 单一模型不足以支撑物理AI,需三者协同:AI Agent在真实世界产生数据→数据反哺模拟器提升逼真度→模拟器生成边缘场景供评估器评分→评估器指导AI Agent优化,形成正向飞轮。
7. 评估体系是核心竞争力
• 模型只是“入场券”,评估指标与验证框架才是长期护城河。物理AI需覆盖从物理层到车载行为层的全链路验证(如Waymo的“安全与就绪框架”)。
• 信任来自公开可验证的长期数据(Waymo公开超2.2亿英里安全数据),而非单次演示。
三、行业趋势判断
Dolgov认为,过去十年AI爆发于数字世界,未来十年将向物理世界延伸。物理AI的机遇在于:生成式世界模型成熟、算力与传感成本下降、Scaling Law验证有效,而核心挑战仍是如何在“快速迭代”与“安全底线”间找到平衡。最终,物理AI的价值不仅是技术指标,更是“让亲人安全回家”的现实意义。