2026-09-19
24岁首席科学家:离开DeepSeek,他赌家庭机器人三年能洗碗
24岁,中科大少年班,MSRA、DeepSeek、字节Seed都待过——按常规路径,他应该继续留在大模型最热的地方。但他转身去了具身智能,去做一台面向家庭的机器人。 这是深朴智能(Simple AI)首席科学家王家伟在十字路口访谈里讲的选择。合肥一中高二考入中科大少年班,后来拿到中科大与微软亚洲研究院联合培养博士资格,在MSRA做文档智能,在DeepSeek参与多模态与DeepSeek-V3预训练数据工作,又在字节Seed早期Agent团队实习。毕业这个节点,他把方向切到了具身。 为什么离开大模型的舒适区 他给的理由不是技术判断,是角色判断——想做一个能自己定义事情的角色。风险承受度高,他引用的是那句「风浪越大鱼越贵」:在里面更有机会做出有突破性的东西。 他对「聪明」的定义也做了修正。思维敏捷的人很多,但那可能不是最重要的一点,最重要的是会提好问题,以及知道自己的不足。他还提到一个反直觉的观察:对researcher来说,工作强度不是产出的必备条件。 自研采集设备,开源2000小时数据 深朴的定位不是纯数据公司,也不是纯模型公司,而是面向家庭提供产品的终端公司。王家伟的解释是,从数据、模型、部署到真机的链路非常长,只有把各环节握在手里,行业出现更好的模型时才能快速follow并迭代到自家产品,更快拿到场景与用户反馈。用他的话说:不是为了做全栈而做全栈,而是有这样的目标,所以不得不做全链路的事。 这条链路的第一环是数据。团队测过市面多款动捕设备,发现精度与时间同步达不到要求,于是自研了HiFi-UMI:六路相机,头部双目加腕部上下相机防止遮挡;抛弃基站,仅靠相机做到毫米级定位;微秒级时间同步;轨迹回放成功率超过95%。 在此基础上,深朴开源了2000小时数据,内部积累数万小时,模型已能在完全不做后训练的情况下完成部分未见过任务。数据标注与清洗环节,他们用GPT-6 Astra辅助。 大脑已收敛,小脑还得自己练 王家伟对通用模型和动作模型的分工判断很明确:GPT-6类通用模型会承担具身上层的大脑与规划,但动态环境中的实时控制仍需专门的动作模型,二者互补而非替代。 他给了一个具体观察:GPT-6 Astra直接驱动机械臂的演示,多为16至32倍速播放,单次推理耗时很长。静态环境可以work,但真实动态场景里杯子倾斜后难以快速recover。大脑侧已经收敛到GPT类范式,沿这条路继续加第一人称视角视频等数据即可,底层必须配上快速反应的action policy。 深朴同时在搭Agentic OS,把system two的理解规划与system one的快速执行连接起来。 没有公认benchmark,只能自己扎实做 具身智能目前缺少公允的benchmark,这是王家伟反复强调的问题。他批评仿真类benchmark(如Libero)可被纯后训练刷分,参考价值有限;真机benchmark又难以复现,别人训的模型没在自己的本体上训练过,直接对比大概率不可用。 他的结论是:最好的方式是自己把评估这件事做得足够扎实。深朴计划发布时公布最真实结果,从简单到困难、覆盖场景与物体泛化,并明确区分zero-shot与few-shot实验中各用了多少数据。 对行业热度,他保持克制。Scaling趋势存在,但不该轻言找到了Scaling Law——他区分「存在幂律现象」与「定义了数据量、模型规模、计算量之间可预测关系的law」,后者需要充分实验验证,非常严肃且耗算力。他也质疑Skild AI通过为demo专门训练获得的in-context learning被高估,因为自然涌现的能力才更具价值,具身领域噱头可能大于真实,需要从第一性原理判断技术点是否正确。 值得关注的方向,他点名了GEN-1.5的one-shot与π0.7的steerability。 三年后,家庭机器人洗碗的概率约80% 访谈最后落到一个具体预测:三年后家庭机器人洗碗的实现概率约80%。这个数字背后是他对全栈路线的押注——数据、模型、部署、真机都握在手里,才有机会把概率变成产品。 特别