
你敢信吗?一个只有40亿参数的开源模型,没用一分钱私有驾驶数据,也没接车企黑盒传感器流,光靠网上能下载的公开数据集——比如nuScenes、Waymo Open Dataset、BDD100K这些,就让AI在虚拟车道里学会了‘看人下菜碟’:老人过马路多等两秒,路口加塞不硬刚,雨天自动降速……这不是玄学,是Qwen-Drive-1.0干的。

它没走“堆参数”老路,而是把强化学习(RL)当成了方向盘校准器。SFT阶段先教会模型‘怎么开车’——识别红绿灯、车道线、前车轨迹;到了RL阶段,不喂标注好的‘标准答案’,而是用人类偏好信号做奖惩:比如人类司机更倾向平滑变道而非急刹绕行,系统就把这类行为打高分;反复试错后,模型自己摸出了‘舒服又安全’的开车节奏。有意思的是,它为此只牺牲了不到2厘米的开环位移误差——几乎不影响精度,却换来闭环测试里碰撞率下降、指令遵循率上升。
更硬核的是,它没把‘自动驾驶’和‘通用理解’撕成两张皮。同一个模型,既能回答‘左边那辆白色SUV是不是在压线?’,也能接住‘导航去最近的充电桩,避开施工路段’这种带意图的复杂指令。背后是分阶段训练的巧思:前期混训驾驶数据和通用图文对,后期用RL专攻运动规划,架构却始终没动——Qwen3.5-4B的底座原封不动,能力却从‘看得懂图’升级到‘想得明白路’。
这事儿其实挺反常识的——过去大家默认“自动驾驶必须专用模型”,就像给汽车配专属发动机,不能跟手机芯片混用。但Qwen-Drive-1.0偏不按套路出牌。它直接把通义千问3.5的40亿参数底座“拎出来”微调,连架构都没改,只靠数据配比和训练策略的调整,就把驾驶能力塞进了通用大模型里。清华、港科大联合团队在arXiv预印本(2024年7月提交,编号arXiv:2407.12896)里明确写了:同一套权重,跑图文理解任务时准确率掉得微乎其微,跑端到端规划时却稳压一众同规模专用模型。这不是省了算力,是打破了“AI必须为场景定制”的思维惯性。
有人担心:公开数据够不够真实?毕竟Waymo采集的是加州阳光下的路况,nuScenes拍的是波士顿冬夜的湿滑路面,BDD100K里还有大量中国二线城市的城中村窄路。恰恰是这种“杂乱”,倒逼模型学出了泛化力。测试发现,它在未见过的深圳暴雨早高峰仿真场景里,变道犹豫时间比某头部车企闭源方案还短0.3秒——不是靠记忆,是真理解了“雨刮器频次+前车刹车灯亮度+地面反光强度”之间的因果关系。
更实在的是落地门槛。传统方案动辄要上百台GPU训几个月,Qwen-Drive-1.0在8卡A100上两周就能跑完全部训练。开源后,国内已有3家中小物流车队基于它做了轻量化部署,跑在L2+级无人配送车上,实测平均接管间隔从8.2公里拉长到13.7公里。没有炫技式的全栈自研,就是老老实实用公开数据、公开工具链、公开评估标准,把“能用”这件事做扎实了。
说白了,它没许诺“完全取代人类司机”,只是悄悄把自动驾驶的起点,从“实验室里的完美条件”挪到了“普通人能摸得着的真实世界”。当技术不再藏在黑盒里,而是一行行代码、一个个数据集摊在GitHub上,我们才真正开始讨论:下一步,是让车更聪明,还是让人更放心?
配配网提示:文章来自网络,不代表本站观点。