DeepSeek-V3

DeepSeek-V3 是全新上线的自研 MoE 大模型,总参数量达 671B,激活参数为 37B,并在 14.8T token 上进行了预训练。在多项评测中,它超越了 Qwen2.5-72B 和 Llama-3.1-405B 等开源模型,性能更是对齐了 GPT-4o 和 Claude-3.5-Sonnet 等顶尖闭源模型。它的百科知识、长文本、代码和数学能力都有了显著提升,中文事实知识更是处于领先水平。生成速度比 V2.5 快了 3 倍,达到了 60 TPS,不过目前暂不支持多模态。模型现已同步开源。

DeepSeek-V3 是全新上线的自研 MoE 大模型,总参数量达 671B,激活参数为 37B,并在 14.8T token 上进行了预训练。在多项评测中,它超越了 Qwen2.5-72B 和 Llama-3.1-405B 等开源模型,性能更是对齐了 GPT-4o 和 Claude-3.5-Sonnet 等顶尖闭源模型。它的百科知识、长文本、代码和数学能力都有了显著提升,中文事实知识更是处于领先水平。生成速度比 V2.5 快了 3 倍,达到了 60 TPS,不过目前暂不支持多模态。模型现已同步开源。

开源框架部分免费官网GitHub ↗
96
热度评分
4.8
评分
免费
起步价
0
对比评测

相关工具