上个月,我被 PDF 文件淹没了。文件夹里躺着 40 篇关于稀疏注意力机制的论文,我需要把它们综合成一篇文献综述来申请科研经费。每次我试着把这些论文喂给其他模型,不是撞上上下文长度限制,就是得到被截断的摘要,或者眼睁睁看着我的 API 账单直线飙升。就在这时候,我决定好好测试一下 DeepSeek V4——主要是冲着它 1M 的上下文窗口,以及它承诺的高性价比长文档处理能力去的。
在连续两周每天用它搞科研之后,以下是我的心得体会,包括我中途踩过的一些坑。
搭建科研工作流
首先要搞清楚的是,DeepSeek V4 分成两个版本,选对版本对科研来说至关重要:
- DeepSeek-V4-Pro:总参数量 1.6T / 激活参数量 49B。这是你的重火力,适合复杂推理、深度分析,以及那些需要模型真正“动脑子”的任务。
- DeepSeek-V4-Flash:总参数量 284B / 激活参数量 13B。速度更快、价格更低,在处理简单任务时表现跟 Pro 惊人地接近。
如果你用的是 API,设置起来很简单。Base URL 跟以前一样——只需要更新模型名称就行:
# 适用于 Python OpenAI 客户端
from openai import OpenAI
client = OpenAI(
api_key="your-deepseek-api-key",
base_url="https://api.deepseek.com"
)
# 用于繁重的科研任务
response = client.chat.completions.create(
model="deepseek-v4-pro",
messages=[...]
)
# 用于快速查找和较简单的任务
response = client.chat.completions.create(
model="deepseek-v4-flash",
messages=[...]
)
这两个模型都支持完整的 1M 上下文窗口和双模式(用于深度推理的 Thinking 模式,以及用于快速响应的标准模式)。这个双模式功能我一开始没当回事,结果在处理不需要深度推理的任务时,白白浪费了时间和金钱。
我踩的第一个坑:所有任务都用 Pro
刚开始的时候,我把所有东西都扔给 V4-Pro 处理。每次文献检索、查个简单的名词解释、做个简单的摘要,全上 Pro。第一天的 API 账单看得我肉疼。
后来我认真看了文档才发现,V4-Flash 在处理简单的 Agent 任务时跟 Pro 不相上下,而且它的推理能力也非常接近 Pro。经过反复试错,我总结出了这套选择策略:
什么时候用 V4-Pro:
- 综合分析 10 篇以上的论文发现
- 演算复杂的数学推导
- 生成结构化的科研产出(文献综述、方法论对比)
- 任何需要持续多步推理的任务
什么时候用 V4-Flash:
- 快速总结单篇论文
- 从文本中提取特定事实或数据
- 格式化或重新整理科研笔记
- 初筛论文,决定哪些值得精读
切换到这种搭配使用的方式后,我每天的 API 花费降到了 1 美元以下——按每天重度科研使用来算,大概也就 30 美元/月。跟以前比起来,这性价比简直高得离谱。
1M 上下文窗口的实际体验
这是最让我心动的一个功能,而且它确实名副其实。它的架构采用了 DeepSeek 所谓的“Token-wise compression + DSA (DeepSeek Sparse Attention)”——一种结合了压缩稀疏注意力和重度压缩注意力的混合方法。根据他们的技术报告,在 1M token 上下文下,其单 token 推理的 FLOPs 仅为此前 V3.2 模型的 27%。
在实际使用中,我做到了这样的事情:
我把 15 篇完整的研究论文(平均每篇 30 页左右)加载到同一个上下文窗口中,让 V4-Pro 找出这些论文在方法论上的矛盾之处。它准确地揪出了三个案例:这些论文引用了同一篇基础研究,却对结果做出了截然相反的解读——这是我自己阅读时都漏掉的地方。
现在,所有 DeepSeek 官方服务默认都开放了 1M 上下文,也就是说你不需要做任何特殊配置就能用。不过要注意,填满这个上下文窗口也是要消耗 token 的,所以加载内容时要有针对性。
与科研工具的集成
这是 V4 对研究人员来说最有趣的地方。它专为集成编程 Agent 而设计,我一直在配合 Claude Code 处理数据分析任务。设置方法如下:
# 为 Claude Code 集成设置环境变量
export ANTHROPIC_BASE_URL=https://api.deepseek.com/anthropic
export ANTHROPIC_AUTH_TOKEN=your_deepseek_api_key
export ANTHROPIC_MODEL=deepseek-v4-pro[1m]
export ANTHROPIC_DEFAULT_OPUS_MODEL=deepseek-v4-pro[1m]
export ANTHROPIC_DEFAULT_SONNET_MODEL=deepseek-v4-pro[1m]
export ANTHROPIC_DEFAULT_HAIKU_MODEL=deepseek-v4-flash
export CLAUDE_CODE_SUBAGENT_MODEL=deepseek-v4-flash
export CLAUDE_CODE_EFFORT_LEVEL=max
然后进入你的项目目录运行 claude。这样你本质上就获得了由 DeepSeek V4 的推理能力和海量上下文驱动的 Claude Code Agent 工作流(包括文件读取、代码执行、多步规划)。
我利用这个组合分析了一个包含 5 万篇研究摘要的数据集。V4-Pro 自己编写了 Python 脚本,找出了聚类模式,还生成了一份总结报告——全都在 Claude Code 的终端界面里完成。智能体编程基准测试显示 V4-Pro 达到了开源 SOTA(最先进水平),从我的经验来看,这绝不是营销噱头。它在处理多文件代码生成时,出错的次数比我预期的要少得多。
如果你更喜欢开源的编程助手,OpenCode 也是一个选择。设置也差不多——安装 OpenCode,输入 /connect,选择 DeepSeek 作为提供商,输入你的 API 密钥,然后选择模型就行了。
一套真正管用的科研工作流
经过两周的迭代,这是我最终固定下来的工作流:
第一步:用 Flash 接收论文
我把 PDF 全扔进一个文件夹,用个简单的脚本提取文本,然后把每篇论文发给 V4-Flash,提示词大概是这样:“用三段话总结这篇论文的方法论、核心发现和局限性。按 1-10 分评估它与稀疏注意力机制的相关度。”
第二步:用 Pro 深度分析
对于评分在 7 分以上的论文,我会把它们连同我的研究问题一起加载到 V4-Pro 的上下文中,要求详细分析:“比较这篇论文中的注意力压缩技术与 CSA 方法。理论上有哪些权衡取舍?”
第三步:用 Pro + 1M 上下文进行综合
在对关键论文逐篇分析完后,我会把最重要的几篇一起加载进去,要求进行跨论文的综合分析。这就是 1M 上下文大显身手的地方——再也不用把文本切分得七零八落,也不用担心丢失连贯性了。
第四步:通过 Agent 集成处理代码和数据
遇到任何计算分析,我就切换到 Claude Code 集成,让 V4-Pro 以 Agent 的方式自主编写代码。
实话实说:局限性
让我直说 V4 在科研方面的短板:
它不是搜索引擎。 我一开始试着用它去找我手头没有的论文。这不是它干的事儿。你需要自己准备好文档和数据。
幻觉依然存在。 当我让它引用上下文中论文的具体页码时,它偶尔会搞错。一定要对照原始材料核实关键引用。
Flash 模型在复杂推理上存在局限。 虽然 Flash 处理简单任务很棒,但我发现它在处理多跳推理链时比较吃力——比如“A 论文主张 X,这与 B 论文的发现 Y 矛盾,但 C 论文通过提出 Z 调和了两者。评价这种调和。”这种活儿还是得交给 Pro。
工具调用因平台而异。 基础开源模型是面向研究使用的,原生不支持工具调用。你需要用 API 版本或 Agent 集成来实现这个功能。
上下文加载需要时间。 塞进将近 1M 的 token 可不是瞬间的事。在我那次 15 篇论文的分析中,初始处理大概花了 45 秒模型才开始回复。虽然不是不能用,但别指望在上下文拉满时还能有秒回的体验。
实用建议
- 在 Agent 集成中一定要加上
[1m]后缀,这样才能用上完整的上下文窗口:deepseek-v4-pro[1m] - 有选择地使用 Thinking 模式。 它更慢也更贵。把它留给真正棘手的问题,别用于常规的摘要任务。
- 对 PDF 做预处理。 直接提取 PDF 文本会很乱。我会先跑一个清洗脚本,去掉不需要的页眉、页脚和参考文献。这能省下 token,还能提高回复质量。
- 批量提问。 不要针对一个文档一次只问一个问题,而是在单个提示词里列出 5-10 个问题。模型处理得很好,而且 token 用得更省。
- 在使用 Agent 集成处理科研任务时,设置
CLAUDE_CODE_EFFORT_LEVEL=max。 对于复杂的分析任务,多花点计算时间是值得的。
DeepSeek V4 并不完美,但对于涉及长文档和复杂推理的科研工作流来说,这是我目前发现的性价比最高的选择。1M 上下文、强大的推理能力,加上即使重度使用也能把 API 费用控制在 30 美元/月以内的价格,让它成了我现在的日常工具。只要聪明地分配不同任务该用哪个模型,并且永远记得核实关键输出,它就绝对靠谱。