魏大峰 Dafeng Wei
研究员 · 智元机器人 (AgiBot)
我的研究方向是视觉语言模型(VLM)与视觉语言动作模型(VLA)——让机器人理解世界,并在真实世界中行动。
此前我在理想汽车智能驾驶团队任高级算法工程师,是 DriveVLM 的核心贡献者——行业首创、首个大规模量产落地的"大小脑"双系统自动驾驶方案;并搭建了服务数据闭环的多模态检索系统。更早在字节跳动任算法工程师。硕士毕业于上海交通大学,师从卢宏涛教授。
动态
- 2026.07 我们发布了 τ0-VLA——世界模型引导测试时计算的分层机器人基础模型。
- 2025.12 GenieReasoner 发布——统一具身 VLM 推理与机器人动作。
- 2025.10 AgiBot World Colosseo 入围 IROS 2025 最佳论文奖 🏆。
- 2025.03 我们开源了 AgiBot World——超 100 万条真机操作轨迹。
- 2024.12 BEV-TSR 被 AAAI 2025 录用。
- 2024.12 我加入智元机器人,研究 VLM 与 VLA。
论文
* 表示共同一作。完整列表见 Google 学术。
2026

τ0-VLA: a Hierarchical Robot Foundation Model with World-Model-Guided Test-Time Computation
技术报告, 2026
分层机器人基础模型:高层规划器以世界模型引导的束搜索在子任务空间做测试时计算,配合可纠错执行记忆,驱动跨本体 VLA——将最长约 12 分钟的真机长程任务成功率从 27.5% 提升到 45.0%。
核心贡献者——从零搭建 AgibotVLA 训练框架,完成初版 VLA 预训练,并端到端完成高层 VLM 规划器的任务定义、数据生产、模型训练与评测。
2025

Unified Embodied VLM Reasoning with Robotic Action via Autoregressive Discretized Pre-training
arXiv 预印本, 2025
GenieReasoner 联合优化具身推理与动作执行,提出 ERIQ 推理基准(6000+ 问答对)与流匹配动作分词器 FACT。

IROS 2025 🏆 最佳论文奖入围 · IEEE T-RO 2026
开放平台:5 大场景 217 项任务、超 100 万条真机轨迹,并提出基于隐式动作表征的通用策略 GO-1。

BEV-TSR: Text-Scene Retrieval in BEV Space for Autonomous Driving
AAAI 2025
在 BEV 特征空间用自由文本检索复杂驾驶场景。
2022
Efficient Dual Attention SlowFast Networks for Video Action Recognition
Computer Vision and Image Understanding (CVIU), 2022
轻量级双流视频动作识别网络,提出跨模态双注意力融合模块 CMDA。
2021

Towards Dynamic and Scalable Active Learning with Neural Architecture Adaption for Object Detection
BMVC 2021
随标注池扩增动态调整网络结构的目标检测主动学习,已在华为亿级自动驾驶数据上落地。
2020

Image-based Table Cell Detection: a Novel Table Structure Decomposition Method with New Dataset
ICPR 2020
以目标检测方式检测表格单元格并恢复表格结构,开源含 17 万单元格标注的 TableCell 数据集。
工作经历
-
2024.12 – 至今
智元机器人 (AgiBot) — 研究员
面向具身智能的视觉语言模型(VLM)与视觉语言动作模型(VLA)。 -
2023.04 – 2024.12
理想汽车 — 高级算法工程师,智能驾驶
DriveVLM 核心贡献者——行业首创的"大小脑"双系统自动驾驶方案,大规模量产落地;服务数据闭环的图文/视频检索。 -
2021.04 – 2023.04
字节跳动 — 算法工程师,TikTok Data 与 EDU
TikTok 多模态视频质量建模;教育业务文档版面分析。
实习经历
-
2020.10 – 2021.03
华为诺亚研究院 — 计算机视觉研究实习生
大规模自动驾驶数据上的目标检测主动学习(BMVC 2021)。 -
2020.04 – 2020.09
海康威视研究院 — 深度学习算法实习生
高效轻量级视频动作识别研究(CVIU 2022),业务落地场景为驾驶员行为分析。
教育经历
-
2018.09 – 2021.03
上海交通大学 — 计算机技术硕士
导师:卢宏涛教授。毕业论文:基于深度学习的高效视频动作识别算法研究。 -
2014.09 – 2018.06
杭州电子科技大学 — 自动化学士
导师:张波涛副教授。
其他
- 🧩 我开发了 ArxivPilot,一个为 arXiv 论文提供阅读辅助的 Chrome 插件——如果你常读论文,不妨一试。
- 🔌 我开发了 StepFunMCP,对接阶跃星辰文本/视觉/文生图/语音模型的 MCP server——已发布到 PyPI(
stepfun-mcp)。 - 🤖 业余时间我持续关注 AGI 与智能体(Agent)的进展。
- ❤️ 持有美国心脏协会(AHA)CPR 与急救认证——随时准备帮忙。