开始使用 DeepSeek V4:实用指南

research入门11 分钟阅读2026/6/28

上个月,我盯着一张 340 美元的 API 账单发呆。其中大部分开销都来自智能体循环(agent loops)——我的编程助手在工具调用、读取文件、修改代码中不停打转,有时候甚至陷入死循环。当你需要为每一个中间思考过程按 token 付费时,成本飙升得非常快。这也促使我开始认真研究 DeepSeek V4。

它的承诺很简单:用极低的价格提供强大的编程能力。经过这两周在托管 API 和本地环境中的深度体验,以下是我的心得,包括一些让我踩坑的意外情况。

选对合适的版本

DeepSeek V4 并不是单一模型,而是一个系列。如果你的硬件或使用场景没选对,这就是你会犯的第一个错误——我也是这么踩坑的。

  • V4-Pro:旗舰款。超大的上下文窗口(最高 1M tokens),推理能力最强。如果你要通过 API 处理复杂的代码生成和智能体工作流,选它就对了。除非你有硬核的多显卡阵列,否则千万别想在本地跑它。
  • V4-Flash:主力款。速度更快、价格更低,处理编程任务依然非常能打。如果你追求高性价比的编程、长上下文路由以及高吞吐量的智能体负载,首选它。如果你硬件允许,它也是本地部署最现实的选择。
  • V4:折中之选。当你觉得 Flash 不够用,又不想付 Pro 的价格时,可以考虑它。

我的教训:一开始,我试图在我的 24GB 显存机器上通过 Ollama 拉取 V4-Pro。结局很惨——模型还没加载完就内存溢出(OOM)了。Flash 才是本地部署的现实选择。

路线 A:通过托管 API 快速上手(最快)

如果你只想马上用上 DeepSeek V4,托管 API 是最简单的路子。不需要显卡,不占硬盘空间——只需一个 API 密钥。

前往 DeepSeek 平台,注册账号并生成 API 密钥。它的 API 兼容 OpenAI,这意味着你只需改动极少的配置,就能把现有的几乎任何工具直接接入。

下面是一个简单的 Python 测试:

from openai import OpenAI

client = OpenAI(
    api_key="your-deepseek-api-key",
    base_url="https://api.deepseek.com"
)

response = client.chat.completions.create(
    model="deepseek-v4-flash",
    messages=[
        {"role": "user", "content": "Write a Python function that finds the longest increasing subsequence in a list."}
    ],
    temperature=0.0
)

print(response.choices[0].message.content)

搞定。如果你用过 OpenAI SDK,这对你来说毫无门槛。

真正有意思的是价格。V4-Flash 比 GPT-4 级别的模型便宜太多了,当你运行那些每轮都要消耗成千上万个 token 的智能体循环时,这点至关重要。

接入 Claude Code

这对我来说是最让人兴奋的地方。DeepSeek 提供了兼容 Anthropic 的 API 端点,这意味着你可以把它当作 Claude Code(Anthropic 的终端编程助手)的后端。最终效果就是:你用着 Claude Code 的界面,花的是 DeepSeek 的价钱。

我的具体操作如下:

首先,安装 Claude Code:

npm install -g @anthropic-ai/claude-code
claude --version

然后配置环境变量。在 Linux/macOS 上:

export ANTHROPIC_BASE_URL=https://api.deepseek.com/anthropic
export ANTHROPIC_AUTH_TOKEN=<your DeepSeek API Key>
export ANTHROPIC_MODEL=deepseek-v4-pro[1m]
export ANTHROPIC_DEFAULT_OPUS_MODEL=deepseek-v4-pro[1m]
export ANTHROPIC_DEFAULT_SONNET_MODEL=deepseek-v4-pro[1m]
export ANTHROPIC_DEFAULT_HAIKU_MODEL=deepseek-v4-flash
export CLAUDE_CODE_SUBAGENT_MODEL=deepseek-v4-flash
export CLAUDE_CODE_EFFORT_LEVEL=max

在 Windows PowerShell 上:

$env:ANTHROPIC_BASE_URL="https://api.deepseek.com/anthropic"
$env:ANTHROPIC_AUTH_TOKEN="<your DeepSeek API Key>"
$env:ANTHROPIC_MODEL="deepseek-v4-pro[1m]"
$env:ANTHROPIC_DEFAULT_OPUS_MODEL="deepseek-v4-pro[1m]"
$env:ANTHROPIC_DEFAULT_SONNET_MODEL="deepseek-v4-pro[1m]"
$env:ANTHROPIC_DEFAULT_HAIKU_MODEL="deepseek-v4-flash"
$env:CLAUDE_CODE_SUBAGENT_MODEL="deepseek-v4-flash"
$env:CLAUDE_CODE_EFFORT_LEVEL="max"

接着进入你的项目目录并启动:

cd /path/to/my-project
claude

这套配置的核心思路是:主模型(干重活的)用 V4-Pro,子智能体(处理快速查询和小任务的)用 V4-Flash。这样既能在关键环节保证质量,又能把成本压下来。

意外踩坑:我第一次运行时,程序静默失败了。后来发现是我的 Node.js 版本太老(16.x)。Claude Code 需要 Node 18+。升级之后,一切完美运行。

路线 B:使用 Ollama 本地运行

如果你希望提示词留在自己的机器上——无论是出于合规要求、隐私考虑,还是单纯不想依赖别人的数据中心——本地部署是必经之路。只要你选对模型,Ollama 能让这事儿变得出奇地简单。

第一步:从 ollama.com 安装 Ollama。macOS、Linux 和 Windows 都有现成的安装包。

第二步:拉取模型。这里得保持理智:

# 24GB 显存显卡的现实选择
ollama pull deepseek-v4-flash

# 只有硬核硬件(80GB+ 显存的多卡阵列)才去尝试
ollama pull deepseek-v4

第三步:运行交互式会话:

ollama run deepseek-v4-flash

第四步:使用兼容 OpenAI 的 API。Ollama 会提供一个本地端点:

from openai import OpenAI

client = OpenAI(
    api_key="ollama",  # 随便填,但 SDK 要求必须传这个参数
    base_url="http://localhost:11434/v1"
)

response = client.chat.completions.create(
    model="deepseek-v4-flash",
    messages=[
        {"role": "user", "content": "Explain this function: def fib(n): return n if n < 2 else fib(n-1) + fib(n-2)"}
    ]
)

print(response.choices[0].message.content)

这招可以完全离线运行。没有 API 密钥,也没有 token 账单。代价就是推理速度——即使你有好显卡,吞吐量也比不上托管 API。

路线 C:使用 vLLM 进行生产级本地部署

如果你要在本地为团队或生产环境做部署,vLLM 才是正解。它仅支持 Linux 且需要 CUDA 12.x,但能提供更好的吞吐量和真正的批处理。

# 安装 vLLM
pip install vllm

# 从 Hugging Face 下载权重(文件很大——V4-Pro 超过 100GB)
git lfs install
git clone https://huggingface.co/deepseek-ai/DeepSeek-V4-Flash

# 启动模型服务
python -m vllm.entrypoints.openai.api_server \
    --model ./DeepSeek-V4-Flash \
    --tensor-parallel-size 2 \
    --max-model-len 32768 \
    --gpu-memory-utilization 0.9

tensor-parallel-size 参数会把模型切分到多张显卡上。请根据你的硬件调整。gpu-memory-utilization 参数告诉 vLLM 可以使用多少显存——设为 0.9 是为了留点余量,避免 OOM 崩溃。

踩坑提醒:我一开始把 max-model-len 设成了完整的 1M 上下文窗口。vLLM 试图为此预分配 KV 缓存,结果瞬间内存溢出。按你的实际需求设置就好。

真实评价与局限性

体验了几周后,以下是我的最终结论:

真正出彩的地方:

  • V4-Flash 在编程任务上的性价比简直离谱。重构、调试、写测试,它几乎都能搞定,花费大概只有我以前的 10-15%。
  • 兼容 Anthropic 的端点这步棋走得很妙。不用重写配置就能把 DeepSeek 塞进现有工具里,太爽了。
  • 如果你有足够的显存,用 Ollama 本地跑 V4-Flash 体验确实不错。

翻车的地方:

  • V4-Pro 绝不是给笔记本跑的。别骗自己能在 MacBook 上本地运行它。就算是 V4-Flash,想要达到能接受的速度,也需要一块像样的显卡。
  • Anthropic 兼容层并不完美。在 Claude Code 中调用工具时,我偶尔会遇到一些怪事——用 Claude 自家模型能正常解析的响应,换成 DeepSeek 就会卡壳。90% 的情况下没问题,但那 10% 的出错率意味着你得时刻留意。
  • 文档还有待完善。很多时候我得把 API 文档、社区论坛拼凑起来看,再加上自己动手试错,这比我预想的要折腾。

实用建议:

  1. 从 V4-Flash 用起。只有当 Flash 搞不定时,再升级到 Pro。
  2. 在 Claude Code 中搭配 DeepSeek 使用时,把子智能体模型设为 Flash。大部分子智能体的工作根本不需要 Pro 级别的推理能力。
  3. 如果在本地跑,对自己的硬件要心里有数。单张 24GB 显存跑 V4-Flash 没问题,跑 V4-Pro 则免谈。
  4. 即使你主要在本地跑,也最好备个托管 API 密钥。做对比测试,或者处理超出本地硬件能力的任务时,你会用得上它的。

我这个月的 API 账单是多少?47 美元。这就是最实在的推荐理由。

相关 Agent

P

Perplexity

AI搜索引擎,提供准确且带引用的答案。

了解更多 →