小鹏正式推出自主研发的TuringViT高效视觉编码器。该模型立足于视觉语言模型与视觉语言动作模型快速发展背景,系统性重构了视觉编码器的整体架构、数据构建方式及训练方法,旨在全面支撑智能驾驶、智能座舱与人形机器人三大核心业务方向。
视觉编码器作为物理人工智能感知能力的基础入口,其性能直接决定系统在真实世界中的响应质量与适应能力。当前行业内普遍沿用开源通用视觉Transformer方案,但在智能驾驶等高要求场景中,该方案在推理速度、实时性、功耗控制及任务适配性等方面已显不足。TuringViT围绕架构设计、数据工程与训练策略三大关键环节实现协同创新,构建起一套完整的技术体系,在模型精度、运行效率与工程落地能力三个维度均取得显著提升。
依托TuringViT的发布,小鹏在物理AI底层技术领域的自主可控能力持续增强。该技术不仅为智能辅助驾驶提供更精准、更稳定的视觉理解支撑,也将推动高分辨率环境感知能力在车载端的规模化部署,助力座舱交互体验向多模态、拟人化升级,并为人形机器人提供具备泛化性与鲁棒性的通用视觉基础能力。

评论
更多评论