紫东太初最新开源通用多模态大模型ZDTaichu5.0-9B,在九大国际权威空间理解基准测试中拿下八项第一,跻身全球多模态第一梯队。
多模态模型长期面临一个难题:能看懂图片的模型,往往难以应对真实物理世界的空间理解与行动任务;而一些为补足空间能力的模型,又要以牺牲通用能力为代价。ZDTaichu5.0-9B在两方面同时实现了突破。
在空间具身能力上,该模型已能完成复杂的空间理解和高层任务规划。实测演示中,它可精准完成从视频目标定位、三视角参照系转换到交互条件判断等任务。例如在目标定位测试中,面对台面上众多干扰物,模型给出的归一化坐标(237,226)精准落在目标标注区域内;在多视角空间推理题中,模型正确判断出目标物体位于右前方;在寻找空闲区域的任务中,其预测也稳稳落入正确区域。这些能力对应目标选择、参照系转换和交互条件判断,是机器人从任务指令到实际执行的关键要素。
从成绩单看,在10B档位开闭源模型中,ZDTaichu5.0-9B呈现断层领先。以MindCube-tiny测试为例,其得分为78.27,而Gemma4 8B-E4B、Gemini 3 Pro和Grok 4分别为48.85、70.87和63.56。
值得注意的是,这个仅有9B参数的模型,在图文理解、文字识别、数学推理和代码能力上依旧稳居第一梯队,并未因空间具身能力增强而出现通用能力降级。