成本塌陷:开源、DeepSeek 与私有化
2024 至 2025 年,Llama 3 与 DeepSeek V3/R1 把大模型推理成本大幅压低;春节前后 DeepSeek 出圈,私有化一体机成为工厂与政企的常见采购形态。
2023 年,企业讨论大模型时绕不开「按 token 付费、数据上云、供应商锁死」三件套。到 2025 年初,局面被两条线改写:开源权重与高效架构把单次推理价格打下去;国内 DeepSeek 在春节前后破圈,把「国产、便宜、能推理」推到大众桌面。采购清单里「私有化一体机」从可选变成标配项——不是追求最新参数,而是要在厂区内网里跑得住、算得清、关得掉。
先给答案
成本塌陷指同等质量任务上的推理费用在 2024—2025 年出现数量级下降:Meta Llama 3(2024 年 4 月 18 日发布 8B 与 70B 版本)继续巩固开源生态;DeepSeek V3(2024 年 12 月 26 日)与 DeepSeek R1(2025 年 1 月 20 日)以 MoE 架构与强化学习推理训练,在公开 benchmark 与 API 定价上同时施压闭源厂商。2025 年农历新年前后,DeepSeek 应用登顶多国下载榜,引发算力股波动与「是否还需要买贵 API」的广泛讨论。企业侧响应是:私有化一体机(预装显卡、推理框架与管控台)与专属云区部署并行,满足数据不出厂、用量可预测、故障可断网的要求。
当时现场
2024 年 4 月 18 日,Meta 发布 Llama 3 8B 与 70B,宣称在同类开源模型中领先,并预告 400B 级仍在训练。云厂商与硬件厂商同日更新「一键部署 Llama 3」镜像;创业公司把「基于 Llama 微调行业模型」写进融资材料。对很多中国企业,Llama 3 的价值不在直接面向公众服务,而在可下载、可改、可内网部署的谈判筹码。
2024 年 12 月 26 日,深度求索公布 DeepSeek-V3 技术报告,强调 671B 总参数、37B 激活的 MoE 设计与极低训练成本叙事。12 月底至 2025 年 1 月,API 定价与性能评测在开发者社区刷屏。1 月 20 日,DeepSeek-R1 发布,强调推理能力并对齐 OpenAI o1 部分场景,部分权重与训练方法开源。
2025 年 1 月下旬至春节前后,DeepSeek 手机应用与网页版在国内破圈:非技术用户开始讨论「免费又好用」,媒体连篇报道「蒸馏」「低成本训练」;同日,英伟达等算力相关股价剧烈波动,市场重新定价「模型便宜化是否削弱卖铲人」。无论股价逻辑是否过度,企业采购心理已变:延迟上云大模型合同,先评估「自建一排 GPU 跑 DeepSeek 或 Llama 要多少钱」。
硬件渠道同期推「大模型一体机」:2U/4U 服务器预装 8×GPU、推理引擎、权限管理与审计日志,报价从数百万到千万人民币,面向政务、金融、能源与大型制造园区。卖点不是「最强」,而是「交付周期短、运维界面中文、支持断外网」。
发生了什么
2024-04-18:Meta Llama 3 8B / 70B 发布。 开放权重(需遵守 Llama 社区许可证),推动本地推理工具链(如 llama.cpp、vLLM、Ollama)普及。
2024 年:API 价格战。 OpenAI、Google、Anthropic 与国内云厂商多轮下调模型 API 价格;开源模型托管费用随竞争下降。企业开始把「每百万 token 单价」写入年度比价表。
2024-12-26:DeepSeek-V3 发布。 技术报告与模型服务同步,强调训练效率与推理吞吐。
2025-01-20:DeepSeek-R1 发布。 推理模型开源策略与 API 低价策略叠加,引发全球开发者与资本关注。
2025 年 1—2 月:DeepSeek 消费级出圈。 应用商店排名、社媒话题与「本地部署教程」并行;多家上市公司在互动平台回应是否接入 DeepSeek。
2024—2025:私有化与一体机采购上升。 政企标书中出现「支持主流开源权重离线推理」「提供模型版本锁定与回滚」等条款;制造企业在园区机房部署用于内部知识库、点检问答与报价辅助,外网可切断。
谁的工作因此变了
CIO 与基础设施团队: 从「买 SaaS API」转向「算力容量规划」:GPU 型号、显存、量化精度(FP16/INT8/INT4)与并发路数成为新名词。一体机厂商与云厂商争夺「谁来做托管」。
采购与财务: 资本支出(CAPEX)一次性买机器 vs 运营支出(OPEX)按 token 付费,需要三年 TCO 模型。DeepSeek 低价 API 使「先 OPEX 试跑、再 CAPEX 固化」路径更常见。
算法与数据团队: 微调 Llama / DeepSeek 类基座成为默认技能,不再绑定单一闭源供应商。蒸馏、量化、RAG 与推理加速(TensorRT-LLM 等)进入工程 checklist。
中小企业: 一体机价格仍高,但「一台工作站 + Ollama + 7B/14B 模型」足以覆盖内部文档问答,使 AI 试点门槛低于 2023 年。
当时看错的地方
误判一:「开源等于零成本。」 显卡、电力、运维、版本升级与安全补丁都要钱;人力往往高于 token 账单。塌陷的是边际推理单价,不是总拥有成本归零。
误判二:「DeepSeek 出圈等于所有场景都该换 R1。」 小模型适合高频简单问答;复杂多模态、工具调用与生态集成仍可能指向闭源旗舰。选型应分场景,不应一次全换。
误判三:「买一体机就合规。」 硬件只是载体,备案、内容安全、日志留存与权限模型仍须软件层实现。关外网不等于自动满足审计要求。
今天还能核对什么
- Meta 2024-04-18 Llama 3 官方博客与模型卡。
- DeepSeek-V3 技术报告(2024-12-26)与 DeepSeek-R1 论文 / 公告(2025-01-20),见 deepseek.com。
- 各云厂商 2024—2025 年 API 调价公告(OpenAI、阿里云、火山引擎等)可对照时间线。
- 2025 年 1 月下旬 DeepSeek 应用商店排名与相关上市公司公告(交易所互动平台)。
延伸阅读
- 上一篇:会想一步:推理模型与产线决策——OpenAI o1 与工艺故障报价。
- 专题目录:大模型发展纪——后续篇目将持续补记进厂、执行与现场侧记。