近日,腾讯混元多模态理解负责人胡瀚提出离职,选择创业。胡瀚曾担任微软亚洲研究院视觉计算组首席研究员,2025年初加入腾讯负责视觉大模型研究,后调入大语言模型部“Frontier”前沿技术研究组,负责多模态理解及世界模型研发,汇报给姚顺雨。前OpenAI研究员、麻省理工学院博士田永龙已于7月初加入腾讯,接替胡瀚负责视觉语言模型(VLM)方向的研发。
此次人事变动背后,是腾讯混元团队战略重心的调整。在算力资源有限(2025年腾讯资本开支792亿元,低于阿里1260亿元及字节计划投入)的背景下,腾讯正重新衡量各AI技术方向的收益。一方面,多模态理解研究已趋于成熟,识别准确率基本达85%以上,继续投入的边际收益递减;另一方面,多模态理解对应的“识图”等场景难以直接商业化,用户更愿为依赖推理、代码和Agent能力的办公场景付费。因此,胡瀚原所在团队未来或将聚焦更具前瞻性的世界模型研究。
自姚顺雨上任以来,将混元基模能力提升至第一梯队成为腾讯AI主线。他密集梳理团队,将人才与算力聚焦于大语言模型部的基础模型研发,撤销AI Lab后核心人员也已并入该部。7月6日,混元交出最新答卷Hy3大模型,在同等参数量下已具备与GLM-5.2、DeepSeek V4 Pro竞争的实力,标志着混元在短短半年内获得了冲击AI Tier 1牌桌的资格。