目录
执行摘要与核心结论
2026 年最新数据补充说明
本版在 2025 年数据基础上,补入 2026 年上半年最新披露,几个动向值得单独拎出来说:
- 第一,Token 价格战基本结束,开始涨价了。DeepSeek 于 2026-08-17(今日)起对 V4 全系执行峰谷定价:V4-Pro 输出高峰 ¥27/百万 token(较此前 ¥6 涨 350%)、闲时 ¥13.5;V4-Flash 输出高峰 ¥9/闲时 ¥4.5。[63] 黄仁勋在 FY27Q1 财报会上直言:"Token 现在能够盈利,模型公司正在竞相生产更多 Token。"[64]
- 第二,算力供给又紧起来了。英伟达 CFO 披露 2026 年至今 H100 租赁价上涨约 20%、A100 上涨近 15%;中国信通院数据显示 2026Q1 国内 AI 算力需求同比 +417%,而有效供给增速只有 128%,和 2025 年的"租价暴跌"正好相反。[65][66]
- 第三,资本开支又上了一个台阶。北美四大云厂商 2026Q1 合计 capex $1,316 亿(+70%),全年指引合计约 $7,100 亿,2027 年预计超 $1 万亿;中国"十五五"算力网建设新增直接投资 4 万亿元。[67][68]
对报告结论的影响:第二部分"纯卖 Token 不成立"的判断得打个补丁:2026 年下半年起,算力/Token 批发模式的毛利空间正在回升(DeepSeek 官方输出价 ¥13.5–27/百万 vs 自建成本约 ¥2.3/百万),"卖 Token"重新成为可行业务线,但垂直场景溢价依然是更稳健的主航道。硬件选型结论不变。
几条基础判断,先说结论
- 市场规模:全球数据中心系统支出 2025 年实际 $5,060 亿(+51.6%)、2026 年预计 $8,220 亿(+62.5%)(Gartner 2026-07 最新口径);IDC 预计全球 AI 基础设施支出 2028 年达 $2,230 亿(2025 年 2 月上调口径)。[1][2][3][78]
- 中国市场:2025 年底全国智算规模 159 万 PFLOPS(FP16)、全球第二,在用机架 1,373 万标准架,建成 42 个万卡级集群。[4]
- 推理为王:Gartner 预计 2028 年 80% 以上的数据中心加速器将用于推理而非训练;全球 AI 推理市场 2025 年约 $1,061 亿,2030 年预计 $2,550 亿(CAGR 19.2%)[5][6];Polaris(2026-04)交叉验证 2026E 约 $1,262 亿[81]。
- Token 单价暴跌:斯坦福 AI Index 2025 测算,GPT-3.5 级性能推理成本 1.5 年降 280 倍;DeepSeek-V3/R1 以约为 GPT-4o 1/10 的价格引爆 2025 年价格战。[7][8]
- 算力供给缓解:H100 云租价从 2023 年峰值 $7–10/小时跌至 2025 年 $2–4/小时,瓶颈已从"芯片短缺"转向"电力短缺"(美国 2025–2028 年预计缺口 44–45GW)。[9][10]
- 竞争格局:英伟达 FY2026 数据中心收入 $1,934.8 亿(+68%);中国 AI 加速卡市场国产份额首次突破 40%(昇腾 81.2 万颗 / 20.4% 份额)。[11][12][13]
- 政策红利:中国"东数西算"+ 地方算力券/模型券(深圳每年最高 1 亿元)大幅降低入场门槛。[14][15]
- 硬件格局:Mac 统一内存(512GB / 819GB/s)可本地跑 671B 级大模型,但生成速度仅为 GPU 服务器的 1/5–1/10;规模化生产推理只有 GPU 集群一条主流路径。[16][17]
- 经济模型:自建 8 卡 H100 集群在 >70% 利用率下约 20 个月回本;盈亏平衡点约 60–70% 利用率,利用率低的时候云租赁明显更划算。[18][19]
- 风险提示:54% 机构投资者认为 AI 股票处于泡沫(美银 2025.10 调查);API 价格战持续侵蚀毛利;芯片管制与国产替代生态差距并存。[20][21]
几点说明(建议先看)
本报告所有数据均来自公开来源并在正文标注编号([n]),文末附录 B 给出完整来源列表与 URL。部分市场预测数字(如推理市场规模)因机构口径不同差异较大,已注明出处与统计口径;涉及厂商自营博客、二手转载的数据已标注"营销口径/需核实"。所有单 Token 成本、ROI 测算均为基于公开假设的估算模型,用于方案比较而非精确财务预测,具体参数已在相应章节列出。
第一部分 行业前景
AI 算力与 Token 市场的现状、规模、驱动力、格局、政策与风险1.1 全球 AI 算力 / Token 市场:现状与规模
1.1.1 全球算力支出处在有记录以来最猛的扩张周期
1.1.2 2026 年 H1 最新动态:增速再次上修,未见放缓
图 1|北美四大云厂商资本开支:2024 → 2026E(亿美元)
1.2 中国市场:智算规模全球第二,一年翻三倍
1.2.1 规模与增速
为什么 2025 年对中国智算是个特殊的年份
工信部等六部门 2023 年《算力基础设施高质量发展行动计划》提出的 2025 年目标(算力 300+ EFLOPS、智能算力占比 35%)已被大幅超额完成(智算 788 EFLOPS、智能算力占比 81%)。"东数西算"八大枢纽 2025 年新增算力占全国新增的 80% 以上,枢纽间 20ms 时延圈基本实现。[4][22] 翻译成人话:国内算力供给的"硬件荒"正在缓解,竞争重心转向"谁能把算力高效变成能卖的 Token 服务"。
1.2.2 2026 年最新:需求爆发 +417%,算力价格重回升势
图 2|中国智能算力规模:2024 末 → 2026Q1(EFLOPS,FP16)
1.3 核心驱动力:需求、成本、商业模式
大模型需求还在井喷,Token 消耗量是指数级增长
推理成本断崖式下降,"Token 变便宜"反而让总量变大
图 3|GPT-3.5 级性能的推理成本崩塌:$20 → $0.07 / 百万 token(1.5 年降 280 倍)
按 Token 计费已经成了 AI 基础设施的标准结算单元
一个绕不过去的悖论:Token 单价在跌,资本开支却在疯涨
2024–2025 年出现罕见组合:Token 售价暴跌(API 价格战)+ 算力资本开支暴涨(数据中心建设成本 $20M+/MW,较传统设施溢价约 2 倍)。[9][23] 结果就是:上游(芯片/电力/机房)吃掉了大部分利润,中游(Token 生产与转售)毛利率被持续挤压。对"AI Token 工厂"的启示:单纯做"买卡 → 出 Token → 卖 Token"的中间商模式在 2026 年已无利可图,必须向"垂直场景应用溢价""私有化数据安全溢价""微调/定制服务溢价"三层价值叠加演进(详见第二部分)。
1.4 竞争格局:英伟达单极 → 中美双轨
| 玩家 | 关键数据(2024–2025) | 定位判断 |
|---|---|---|
| 英伟达 | FY2025(截至 2025-01):营收 $1,305 亿(+114%),数据中心 $1,152 亿(+142%);FY2026(2025 自然年):营收 $2,159.4 亿(+65%),数据中心 $1,934.8 亿(+68%),占营收近 90%[11][12];FY27Q1(2026-05)单季营收 $816 亿(+85%),数据中心 $752 亿(+92%)[64] | 全球绝对霸主;Blackwell(GB300/NVL72)需求超预期,TOP500 中 75%+ 采用其技术;Vera Rubin 平台 2026Q3 出货 |
| AMD | 2026Q1 营收 $103 亿(+38%),数据中心 $58 亿(+57%);与 OpenAI、Meta 各达成 6GW Instinct GPU 部署合作(MI450 Helios 平台 2026H2 量产);预计 2027 年 Instinct 收入达数百亿美元[24][80] | 英伟达最强挑战者,生态差距仍在;数据中心已成核心增长支柱 |
| 华为昇腾 | 2025 年中国市场出货 81.2 万颗(份额 20.41%,占国产 AI 芯片出货近 50%);910C 推理速度约为 H100 的 60%(外媒独立测试);深圳万卡 910C 超节点实测故障率 0.3‰[13][25][26] | 中国国产替代龙头,训练生态仍落后(CUDA vs CANN) |
| 寒武纪 | 2025 年营收 64.97 亿元(+453%),净利润 20.59 亿元,扭亏为盈;市值一度近 5,000 亿元[27] | A 股"国产算力"核心标的,业绩兑现拐点 |
| 国产整体 | 2025 年中国 AI 加速卡出货约 400 万张:英伟达 220 万张(55.22%,从制裁前约 95% 大幅下滑);国产合计 165 万张(份额首破 40%)[28] | 中美双轨格局确立;黄仁勋自述英伟达在华高端芯片份额"从 95% 降至 0%" |
| 云厂商 | 五大超大规模云 2026 年 capex 预计 $5,310 亿;H100 云租价跌至 $2–4/小时[9][10] | 算力供给主体正从"卖卡"转向"卖算力服务" |
1.5 政策环境:中国红利密集释放,美国管制持续收紧
中国:从"东数西算"到"算力券",政策全面托底
- 顶层规划:《算力基础设施高质量发展行动计划》(工信部等六部门,2023-10),2025 年的目标已经超额完成;《算力互联互通行动计划》(2025-05)提出 2028 年实现全国公共算力标准化互联;国务院 2025-08 印发《关于深入实施"人工智能+"行动的意见》。[22]
- "东数西算"工程:八大枢纽持续集聚算力(2025 年枢纽新增算力占全国 80%+),全国一体化算力网监测平台已接入 1,129 个算力设施。[4]
- 地方补贴(算力券/模型券):深圳每年最高 1 亿元"模型券"(单企业最高 100–200 万/年、抵扣最高 30%);东莞最高 5,000 万元算力券;珠海总额最高 5 亿元算力券 + 1 亿元模型券;广州黄埔三类券各最高 1,000 万元。[15]。地方补贴算是中小 Token 工厂最重要的"入场券"。
- 电价红利:西部绿电区度电 0.20–0.35 元(内蒙古乌兰察布约 0.35 元、甘肃庆阳低至 0.2188 元),东部 0.60–0.80+ 元,"Token 工厂"放西部能省一半以上的电费。[29]
美国:出口管制层层加码,国产替代被迫加速
- 2024-12-02:BIS 新增 140 家实体清单(136 家中国公司),首次对 HBM 高带宽内存实施管制(带宽密度 >2GB/s/mm² 的 HBM 对华出口受限,当时所有量产 HBM 均超标)。[30]
- 2025 年 H20 博弈:4 月实质禁售(英伟达计提 $55 亿减值);7 月 15 日获准恢复对华出口(仅限库存);8 月英伟达转向面向中国的 Blackwell 衍生品 B30A。[21]
- 影响量化:摩根大通测算 2024 年中国芯片自给率约 34%,预计 2027 年大幅提升(预测值);英伟达在华高端 AI 芯片份额"从 95% 降至 0%"(黄仁勋 2025-10 表态)。[21][31]
- 启示:中国"Token 工厂"的硬件供应链已不可逆地分为"英伟达合规线(H20/B30A)"与"国产线(昇腾/寒武纪/海光)"两条,选型必须考虑合规与供应链安全(详见第三部分)。
1.6 潜在风险:电力瓶颈、泡沫争议、价格战与生态差距
| 风险类别 | 关键事实与数据 | 对"Token 工厂"的影响 |
|---|---|---|
| 电力供给瓶颈 | Morgan Stanley:美国 2025–2028 年数据中心新增用电需求 65GW,可用供给仅 21GW,缺口 44–45GW(约等于意大利全国用电量);GenAI 耗电 2023 年 20 TWh → 2025 年 165 TWh → 2028 年预计 675 TWh[10] | 选址决定生死:西部绿电区/近电网节点是唯一解;电费占运营成本 50%+(东部更高) |
| AI 资本开支泡沫争议 | 美银 2025-10 调查:54% 机构投资者认为 AI 股票处于泡沫;2023–2025 全球 AI 基础设施投入约 $5,600 亿,而 AI 软件与服务收入远低于此;纳德拉承认"芯片插不上电"问题[20][32] | 融资环境随时可能收紧;现金流为正的垂直场景比"烧钱囤卡"更安全 |
| Token 价格战 → 涨价周期 | 旗舰模型输入价 17 个月降 8 倍;H100 租价 2 年跌 60%+[7][9];但 2026 年 H1 反转:H100 租价回升 20%,DeepSeek-V4 输出价上调 350%[63][65] | 毛利正在修复;但"涨价后需求是否回落"是新的观察点,定价策略(峰谷/错峰)成为运营必修课 |
| 技术换代风险 | GPU 世代 2–3 年换代(A100→H100→H200→B200),单卡价格 $25K–45K,自购存在技术过时风险[33] | 自建资产折旧周期必须 ≤3 年;云弹性部署对冲换代风险 |
| 国产生态差距 | 昇腾推理可达 H100 的 60%,但训练生态(CANN vs CUDA)差距明显,框架兼容性成本高[25] | 国产线适合推理型 Token 工厂;训练/前沿研发仍依赖英伟达合规卡或海外云 |
第二部分 分阶段投入规划
前期验证 → 中期扩容 → 后期规模化| 阶段 | 时间 | 轻资产档 | 标准档(推荐) | 重资产档 |
|---|---|---|---|---|
| 前期 | 0–6 月 | 15–40 万 (Mac 开发机 + 云 GPU 按需) |
150–350 万 (1 台 8 卡 H100 整机或等量云预留) |
500–1,000 万 (2 台 8 卡 + 机房机柜 + 团队 5–8 人) |
| 中期 | 6–18 月 | +20–60 万 (长期云预留实例 / 扩容 Mac) |
+300–800 万 (加购 1–2 台 8 卡,或引入昇腾 910C 混合) |
+1,000–3,000 万 (整机房扩容、液冷改造、多集群) |
| 后期 | 18–36 月 | 按需追加 (维持弹性,不沉淀重资产) |
1,000–3,000 万 (多元算力:英伟达 + 国产 + 云弹性) |
5,000 万–2 亿 (双机房、PUE 优化、全国节点) |
2.1 前期(0–6 月):验证期:设备采购 / 机房部署 / 团队组建
阶段目标
用最小成本验证三个问题:① 目标客户是否真的愿意为 Token 服务付费(付费意愿验证);② 自建 vs 云 API 的成本结构是否成立;③ 技术链路(模型部署 → 推理优化 → API 网关 → 计费)是否跑通。
预算与成本结构(标准档示例,合计约 150–350 万)
| 成本项 | 金额区间 | 占比 | 说明 |
|---|---|---|---|
| 硬件采购 | 180–250 万(可选:首年以云预留替代,约 100–150 万/年) | 65–75% | 8 卡 H100 整机($250–460K);或先租后买:H100 云价 $2–4/卡时,8 卡 24/7 月成本约 ¥8–17 万[9][18] |
| 开发机 | 8–15 万 | 5% | Mac Studio M3 Ultra 512GB(¥74,249)或 256GB(约 ¥5 万)用于开发调试、私有数据推理、超大模型试验[34] |
| 机房/托管 | 月 5,000–20,000 | 5–8% | 整机柜托管(8–10kW);或租用智算中心机柜(西部托管电费更优) |
| 电力 | 月 1.3–3 万 | 5–8% | 8 卡满负荷 10kW;西部 0.35 元/度 vs 东部 0.65 元/度,差距约 2 倍[29] |
| 网络与带宽 | 月 2,000–8,000 | 2–3% | BGP 带宽 + 高防;出 Token 服务对带宽时延敏感 |
| 团队人力 | 月 5–10 万 | 10–15% | 2–5 人:算法/推理优化 1–2 人、后端/API 1–2 人、产品运营 1 人 |
| 软件与合规 | 3–8 万 | 2–3% | 推理框架(vLLM/SGLang)、监控、备案/合规咨询 |
参考:华为云 10MW 智算中心 TCO 模型:GPU 服务器占 CAPEX 52%,年 OPEX 约 $2.56M/MW;美国全口径数据中心 CAPEX 约 $37.6–38M/MW(IT 设备占 2/3)。[19][35]
关键里程碑(前期)
2.2 中期(6–18 月):扩容期:扩容 / 运维 / 优化
阶段目标
把"验证过的客户需求"转化为稳定产能:扩容到 2–3 个 8 卡集群,建立标准运维体系,把单 Token 成本降到云 API 批发价以下,实现盈亏平衡或接近盈亏平衡。
扩容决策要点(结合数据)
- 自建 vs 云租赁的盈亏平衡点约为 60–70% 利用率:持续利用率 >70% 且预期 >18 个月时自建 8 卡 H100(约 ¥250 万)优于云租(8 卡云租年成本约 ¥100–140 万),约 20 个月回本;大多数组织实际 GPU 利用率仅 40–50%,扩容前必须先测真实利用率。[18][36]
- 容量规划参考:70B FP8 权重约 70GB,单张 H100 80GB 刚好装下但 KV cache 仅剩约 10GB(高并发风险);H200(141GB)单卡可替代 2 张 H100,长上下文场景优先 H200。[37]
- 国产算力选项:昇腾 910C(推理约为 H100 的 60%,FP16 780–800 TFLOPS)成本与供给受政策支持,适合推理为主的中期扩容;注意 CANN 生态迁移成本。[25]
- 电力是隐性瓶颈:每加一个 8 卡机柜 = 10kW 电力 + 散热;机房扩容前先确认电力配额(参考:美国数据中心 2025–2028 年电力缺口 44–45GW)。[10]
运维与优化体系(中期核心工作)
| 维度 | 关键动作 | 量化目标 |
|---|---|---|
| 推理优化 | vLLM/TensorRT-LLM 批处理、PagedAttention、FP8 量化、前缀缓存 | 高并发吞吐提升 2–5 倍(H100 70B:单流 120 → 100 并发 2,400 tok/s)[17] |
| 调度弹性 | 自建集群保底 + 云 GPU($2–4/卡时)吸收峰值 + 外部 API(DeepSeek 等)兜底 | 峰值利用率 >90%,空转率 <15% |
| 监控告警 | GPU 温度/显存/吞吐/延迟/TTFT 全链路监控 | TTFT <200ms,P99 时延达标 |
| 成本核算 | 每集群每周输出单 Token 全成本报表(硬件折旧+电+运维+人力分摊) | 单 Token 成本持续下降,月度复盘 |
| 能耗优化 | PUE 管理、错峰运行(借鉴 DeepSeek 夜间 50–75% 折扣策略) | PUE ≤1.3(全国超大型设施均值 1.34)[4] |
关键里程碑(中期)
2.3 后期(18–36 月):规模化扩张 / 多元算力 / 盈利模式
阶段目标
从"算力转售"升级为"算力 + 应用"复合体:多元算力(英伟达/国产/云弹性)对冲供应链与政策风险,垂直场景产品贡献 60%+ 毛利,ROI 转正。
多元算力架构(推荐的后期形态)
| 算力池 | 定位 | 比例建议 | 理由 |
|---|---|---|---|
| 英伟达集群(H200/B200 级) | 高并发生产推理 + 微调 | 40–50% | 生态最成熟、吞吐最高;B200 单 Token 成本较 H100 降 20 倍[8] |
| 国产算力(昇腾 910C / 寒武纪) | 推理主力 + 政策合规场景 | 20–30% | 供应链安全;可申报算力券补贴(深圳模型券最高抵扣 30%)[15] |
| 云弹性池(H100 按需) | 峰值吸收、地域就近 | 15–20% | $2–4/卡时,随用随停,对冲技术换代风险[9] |
| 外部 API 兜底(DeepSeek 等) | 长尾/超低价场景 | 5–10% | 2026-08 起 DeepSeek-V4 峰谷定价(输出高峰 ¥27/闲时 ¥13.5),批发转售价差重新打开[63] |
四大盈利模式(按毛利从高到低)
| 模式 | 定价逻辑 | 毛利空间 | 实施要点 |
|---|---|---|---|
| ① 垂直场景 SaaS | 按业务价值收费(如客服 Agent 按坐席、内容工厂按篇) | 60–85% | 推理成本控制在营收 25–30% 以内(行业经验值)[39];避开与 OpenAI/DeepSeek 直接比价 |
| ② 私有化部署 + 数据安全溢价 | 一次性授权 + 年维护费 | 50–70% | 政企客户对"数据不出域"付费意愿强;Mac/国产卡组合满足合规审查 |
| ③ 模型微调 / 定制服务 | 项目制 + 持续推理分成 | 40–60% | 8B–70B 微调是中小 Token 工厂的差异化入口 |
| ④ 算力/Token 批发 | 按 Token 或 GPU 时计费 | 10–30% | 仅在高利用率 + 批量场景成立(详见 2.5 测算);可叠加地方算力券降低实际成本[15] |
关键里程碑(后期)
2.4 三类投入策略的 ROI 对比
| 策略 | 累计投入(36 个月) | 年化收入目标 | 回本周期 | 适合谁 |
|---|---|---|---|---|
| 轻资产(云为主) | 40–120 万 | 30–80 万(纯应用层毛利) | 18–24 个月 | 个人/小团队;先验证再重投;零硬件折旧风险 |
| 标准(自建+弹性) | 300–900 万 | 300–500 万(垂直 SaaS + 批发组合) | 约 20–24 个月(需利用率 >70%)[18] | 有明确客户的创业团队;本报告推荐路径 |
| 重资产(规模化) | 2,000 万–2 亿 | 数千万级 | 3–4 年(参照华为云智算 ROI:基础 4.2 年 / 液冷优化后 3.1 年)[19] | 有融资能力的机构;对标区域智算中心运营 |
2.5 单 Token 成本测算模型(核心决策工具,所有假设公开)
假设:70B 级 FP8 模型;vLLM 高并发;硬件按 5 年折旧(GPU 世代 2–3 年,实际按 3 年更保守);西部电价 0.35 元/度;汇率 7.2。产能引用实测基准:单卡 H100 100 并发聚合吞吐 2,400 tok/s。[17]
| 方案 | 月产能(tokens) | 月全成本 | 单 Token 成本(元/百万) | 对标市价 | 结论 |
|---|---|---|---|---|---|
| Mac Studio M3 Ultra 512GB ×1(单机) | 约 5,000 万(40 tok/s 聚合 × 24h × 50% 负载) | 约 2,600 元(折旧 2,062 + 电 46 + 杂项 500) | 约 50–200 元 | DeepSeek-V4 输出 ¥13.5–27/百万[63] | 单机量产没有经济性,定位是"容量+安全"而非"便宜" |
| 8 卡 H100 集群(30% 负载) | 约 149 亿 | 约 6.9 万(折旧 4.2 万 + 电 0.8 万 + 运维 2 万) | 约 4.6 元 | — | 接近 DeepSeek 输出价,仅适合高价值场景 |
| 8 卡 H100 集群(70% 负载) | 约 348 亿 | 约 7.9 万(电随负载升至 1.8 万) | 约 2.3 元(≈$0.32) | DeepSeek-V4 输出 ¥13.5–27;B2B 批发 ¥10–20 | 成本优势扩大:约为官方 API 的 1/6–1/12,毛利 80–90%+ |
| 纯云 API 转售 | 不限 | 按量 | 约 1.9–7 元(进价) | — | 零资产风险,但毛利被上游锁定,适合起步期 |
测算结论(2026-08 更新):① Mac 不适合做 Token 量产单元(单 Token 成本高出集群 20–100 倍);② 8 卡 H100 集群在 70% 利用率下成本约 ¥2.3/百万 token,而 DeepSeek-V4 官方输出价已涨至 ¥13.5–27(高峰),自建成本只有官方价的 1/6–1/12,毛利空间较 2025 年显著扩大;③ 30% 利用率下自建约 ¥4.6/百万,仍低于官方闲时价,利用率依然是 Token 工厂的生死线,但 2026 年的定价环境给了自建模式更大的安全边际。[63][18]
图 4|每百万 Token 成本对比(元/百万 token,对数刻度)
交互式计算器:AI Token 工厂成本测算 离线可用
基于 2.5 节测算模型:拖拽/下拉调整参数,右侧实时输出。模型假设:70B FP8 + vLLM 高并发;H100 整机 19,200 tok/s(100 并发/卡,[17]);H200 按带宽优势保守取 21,000 tok/s;5 年折旧(Mac 3 年);运维与电费按报告口径。数值为估算参考,投产前请用自有 POC 校准。
第三部分 硬件选型对比
Mac(Studio / Pro)vs 服务器 GPU 集群(A100 / H100 / H200)3.1 两大战术的核心差异:容量与带宽的错位
LLM 推理是显存带宽瓶颈型任务:生成每个 Token 都要读一遍全部权重(70B Q4 量化 ≈ 42GB)。因此衡量推理硬件的两个核心指标是显存(装得下多大模型)与带宽(每秒能吐多少 Token):
- Mac 阵营(统一内存):入门级 Mac mini M4 Pro 64GB(273GB/s,约 ¥1.6 万)已能本地跑 70B Q4(9–11 tok/s),是超前期开发机的高性价比选择[82];再往上走,M3 Ultra 最高 512GB 统一内存,官方称可完整在内存中运行 6,000 亿参数级模型[16],实测 DeepSeek-R1 671B Q4(448GB)、V3-0324 685B 4bit 均可在单机运行,这是任何单卡 GPU 做不到的。2026 年新品 M4 Ultra(最高 192GB)速度更快但容量上限收窄,Mac Pro 已停产[77]。带宽 819GB/s(M3 Ultra),大约是 H100(3.35TB/s)的 1/4。[40]
- GPU 服务器阵营:带宽猛兽,H100 SXM5 带宽 3.35TB/s、H200 达 4.8TB/s,配合 vLLM 等推理引擎的连续批处理,单卡 100 并发可达 2,400 tok/s,是 Mac 单机(15–30 tok/s)的 80–160 倍。[17][41]
- 先把结论放这儿:Mac 强在"一次装下超大模型 + 数据不出设备 + 低功耗静音";GPU 集群赢在"吞吐、并发、扩展、生态"。两者不是谁替代谁,是互补关系。
3.2 详细规格与实测性能对比表(2025–2026 最新数据)
| 维度 | Mac mini M4 Pro 64GB(小主机) | Mac Studio M3 Ultra(512GB) | Mac Studio M4 Ultra(192GB,2026 新品) | A100 80GB SXM | H100 SXM5 80GB | H200 SXM 141GB | B300(Blackwell Ultra,2026 主力) |
|---|---|---|---|---|---|---|---|
| 市场价(2026) | $2,199(64GB 顶配,约 ¥1.6 万);M4 基础版 $599 起[82] | $11,699 / ¥74,249(512GB+1TB)[34] | $1,999 起;192GB 高配约 $5,000–9,000+[77] | 云租 $0.66–4/卡时[9] | 新卡 $35–40K;二手 $6–22K;云租 $1.85–4.5/卡时(2026H1 租价回升 20%)[33][43][66] | $38–45K;渠道 $45–50K[44] | 单卡约 $53K(无零售,随整机);云租 $7.1–17.8/卡时[75][76] |
| 内存/显存 | 64GB 统一内存 | 512GB 统一内存 | 最高 192GB 统一内存[77] | 80GB HBM2e | 80GB HBM3 | 141GB HBM3e | 288GB HBM3e(单卡可装 200B+ 模型) |
| 内存带宽 | 273GB/s(M4 Pro;基础 M4 为 120GB/s)[82] | 819GB/s[40] | 800GB/s(实测 806GB/s,M2 Ultra 的 1.8 倍)[77] | 2.039TB/s | 3.35TB/s | 4.8TB/s | 8TB/s(H200 的 1.7 倍) |
| 算力(FP16/FP8) | 20 核 GPU(M4 Pro) | 约 24 TFLOPS(GPU 部分) | 80 核 GPU(双 M4 Max 融合) | 312 TFLOPS(FP16) | 990(FP16)/ 1,979(FP8 稠密) | 同 H100(FP8 1,979) | FP8 2,250 TFLOPS(稠密)+ 原生 FP4(推理 2× FP8) |
| 70B 模型生成速度 | 9–11 tok/s(Q4/MLX,单用户)[82] | 15–30 tok/s(Q4/MLX,单用户)[48] | 与 M3 Ultra 同级(带宽相近;单用户 20–35 tok/s,估算)[77] | 约 56 tok/s(单流)[50] | 120 tok/s 单流;2,400 tok/s @100 并发[17] | ≥H100(KV 缓存更足) | 高并发吞吐显著高于 H100(带宽 2.4×,估 3,000+ tok/s @100 并发);单卡直跑 200B+ |
| 可承载最大模型 | 70B Q4(约 40GB,紧);30B Q5 舒适[82] | 671B Q4 / 685B 4bit 单机可跑[51] | 100B 级(70B Q8 / 405B 极限量化)[77] | 70B FP8(紧) | 70B FP8(KV 仅剩 ~10GB)[37] | 70B FP8 + 大 KV;单卡替代 2×H100 | 单卡 200B+ / 1T 级 MoE 分片,无需跨卡分片 |
| 功耗(满载) | 65–100W(安静) | 约 215W 实测[52] | 约 200W(跑 671B 实测)[77] | 400W | 700W | 700W | 1,400W(必选液冷) |
| 每瓦性能(70B 推理) | 约 0.11 tok/s/W(估算) | 约 0.065 tok/s/W[53] | 约 0.07–0.11 tok/s/W(估算) | — | 0.17 tok/s/W(单流) | — | — |
| 互连扩展 | Thunderbolt 5 | Thunderbolt 5(80–120Gbps,RDMA 实验性集群)[54] | NVLink 4 900GB/s + InfiniBand 400Gb/s 组网[41] | NVLink 5 / GB300 NVL72 机架(72×B300,21TB HBM3e,~132kW)[75] | |||
| 部署环境 | 桌面静音,巴掌大小 | 桌面/办公环境,静音 | 数据中心:液冷/风冷、700W 供电、机柜散热 | 数据中心液冷必选(80–120kW/柜时代) | |||
| 工具链 | MLX / llama.cpp / Ollama | MLX / llama.cpp / Ollama / Exo | CUDA / vLLM / SGLang / TensorRT-LLM(生产级) | 同左 + FP4 推理栈 | |||
8 卡整机对比:DGX H100($250–460K / 640GB / ~10kW)|DGX H200($400–500K / 1.1TB / ~7kW)|DGX B300($300–350K / 2.3TB / ~14.5kW / FP4 144 PFLOPS,2026 年出货,对华受管制)[75][76]。注:单流速度指单用户连续生成;聚合吞吐指多并发批处理。Mac 实测数据来自 MLX/llama.cpp 社区基准(omlx.ai、insiderllm、Jeff Geerling 等);GPU 数据来自 NVIDIA 官方规格 + cloudai.pt 2026 vLLM 实测。Mac Pro(M2 Ultra)已于 2026 年 3 月正式停产,由 Mac Studio M4 Ultra 顶替[77];标"估算"的为基于带宽/算力推算,非实测。
3.3 单 Token 成本与性价比专项测算
核心结论:按"每百万 Token 全成本"排序:8 卡集群(高利用率)< H100 云租(含利润)< 8 卡集群(低利用率)< Mac 单机 << Mac 集群。Mac 的性价比体现在"每万元能买到的内存容量"而非 Token 产量:
| 购买对象 | 价格 | 可运行模型 | 每万元内存 | 单 Token 成本(70B) |
|---|---|---|---|---|
| Mac mini M4 Pro 64GB | 约 ¥1.6 万 | 70B Q4(紧)/ 30B Q5 舒适 | 40GB/万元 | 单 Token 成本高于集群;适合开发与超前期验证 |
| Mac Studio M3 Ultra 512GB | ¥74,249 | 671B Q4 / 685B 4bit | 6.9GB/万元 | 50–200 元/百万(量产无优势) |
| H200 单卡 | 约 ¥28–33 万 | 70B FP8 + 大 KV | 0.43GB/万元 | 单卡难支撑规模化,多卡才有意义 |
| 8 卡 H100 整机 | 约 ¥180–330 万 | 多租户并发 | 0.24GB/万元(640GB) | 约 2.3 元/百万(70% 利用率) |
3.4 扩展性与运维现实(常见误区澄清)
| 议题 | Mac 阵营 | GPU 服务器阵营 |
|---|---|---|
| 多机集群 | Thunderbolt 5 RDMA 已可实现 4 机 1.5TB 统一内存池(macOS 26.2 + Exo),实测 Qwen3 235B 达 31.9 tok/s、Kimi K2 Thinking 25 tok/s@280W,但 TB5 没有交换机只能菊花链、节点数受限、实验性质,Geerling 本人称"无法为这笔钱找到合理理由"[54][56] | NVLink(900GB/s/卡)+ InfiniBand(400Gb/s)+ NVSwitch,8 卡至 72 卡(GB200 NVL72 机架)成熟扩展;生产唯一主流路径[41] |
| 4 机 Mac 集群成本 | 约 $40,000(2×512GB + 2×256GB)≈ ¥29 万,1.5TB 内存确实便宜(每 GB 约 ¥193) | 1.5TB 显存等价配置需 8–10 卡 H200/B200,成本 $380K+ ≈ ¥270 万+ |
| 故障与运维 | 整机更换即可,无需机房;但高负载偶发系统崩溃[56] | GPU 故障率高发、需备件库与 7×24 值守;参考深圳万卡昇腾集群故障率 0.3‰ 级别[26] |
| 噪音/物理环境 | 静音桌面设备,办公室可用 | 8 卡整机噪音 90dB+,必须机房 |
| 云替代 | 无(Mac 云实例极少见) | 完整:H100 $1.85–4.5/卡时、H200 $3.5–4.5、B200 $4–6[43] |
3.5 选型建议:按规模与场景的决策矩阵
| 你的情况 | 推荐方案 | 预算参考 | 理由 |
|---|---|---|---|
| 个人开发者 / 起步验证(日 Token 量 <1,000 万) | Mac mini M4 Pro 64GB(约 ¥1.6 万)起步 + 云 GPU 按需 + 外部 API 兜底;需求升级再上 Mac Studio 512GB | 3–25 万 | 一台 mini 即跑 70B Q4(9–11 tok/s)[82],数据安全、零机房成本;验证期不沉淀 GPU 资产 |
| 小团队 / 内部工具(日 1,000 万–1 亿) | Mac 开发机 + 1 台 8 卡 H100(或长期云预留) | 200–350 万(或云年付 100–150 万) | 70% 利用率下自建成本约 ¥2.3/百万 token,约为官方 API 1/7;云预留对冲利用率不足风险[18] |
| 商业 Token 工厂(日 1 亿+) | 8 卡 H100/H200 集群起步,H200 优先(长上下文/大 KV);预算充足可选 B300(单卡 288GB 直跑 200B+,省跨卡分片) | 300–1,000 万 | H200 单卡替代 2 张 H100、KV 充足支撑高并发;B300 单 Token 成本更低但需液冷且对华受管制[37][75] |
| 政企 / 数据敏感 / 合规场景 | Mac(本地开发)+ 国产算力(昇腾 910C)集群 | 按需 | 数据不出域 + 供应链合规 + 可申报算力券(最高抵扣 30%)[15][25] |
| 研究 / 超大模型试验(671B+ 级) | Mac Studio 512GB ×2–4(RDMA 集群) | 15–30 万 | 唯一能在桌面上跑 671B 级 MoE 的方案;实验性质,不建议承载生产 SLA[54][56] |
| 规模化生产(多集群) | GPU 集群(H200/B200)+ 云弹性池 + 国产合规池 | 1,000 万+ | 吞吐、扩展、生态三要素只有 GPU 集群齐备;Mac 退出生产位,退居开发/试验位[41] |
3.6 推荐混合部署方案(三池架构)
| 池 | 构成 | 职责 | 成本特征 |
|---|---|---|---|
| 开发试验池 | 1–2 台 Mac Studio 512GB(约 ¥15 万) | 模型评测、私有数据推理、超大模型试验、演示 POC、客户现场部署原型 | 一次性投入低;电费几乎可忽略(215W) |
| 生产算力池 | 自建 8 卡 H100/H200 集群(约 ¥250–500 万) | 主力推理:70B–405B 级、高并发 API 服务、批量生成、微调 | 固定成本主导;70%+ 利用率时单 Token 成本最低 |
| 弹性缓冲池 | 云 GPU($2–4/卡时)+ 外部 API(DeepSeek 等) | 峰值吸收、地域就近、新模型快速试水、兜底 SLA | 纯变动成本;随用随停,对冲技术换代[9][38] |
流量调度逻辑:API 网关按"优先级 + 成本 + 时延"路由:常规请求进生产池(成本最低);突发峰值溢出到弹性池(贵但零等待);超长尾/超低价场景直连外部 API(避免自建资源空转)。数据敏感请求强制落在本地池(Mac 或国产卡),满足合规。这一架构兼顾成本、弹性与合规,是 2025 年行业共识的形态。
选型红线(结合市场数据)
- 不要用 Mac 集群扛生产并发:TB5 菊花链无交换机、节点受限,吞吐远低于 GPU 集群,Geerling 实测 4 机集群性能甚至低于单机场景。[56]
- 不要在高位囤 H100 新卡:2023 年二级市场曾炒到 $80–120K/张,2025 年二手已跌至 $6–22K(较峰值 -85%),市场已经证明"囤卡"是高风险动作。[33]
- 不要忽视合规:H20 政策一年内三次反转(禁售→解禁→停产的教训);面向政企的 Token 工厂必须准备国产算力替代路径。[21]
- 不要把"每瓦性能"当唯一指标:Mac 每瓦性能虽优,但产量绝对值低;每瓦 × 每卡吞吐 × 总装机量才是收入公式。
3.7 光伏余电 + Token 工厂:广东中山工业园场景测算 离线可用
场景:工业园屋顶光伏在白天午间存在大量"消纳不完"的余电(广东现货市场已出现负电价时段,午间电近乎白给 [73])。把余电喂给 GPU 集群做批处理推理/微调,是典型的"算电协同",电费从"卖不掉"变成"直接创造收入"。拖动滑杆测算:
落地要点(结合中山实际)
- 电力账算得过来吗?:广东 2025-11-01 起新能源电量全面入市,增量项目机制电价 0.36 元/度、存量 0.453 元/度,2026 年度交易均价下限暂定 0.372 元/度 [72][73];余电自用的机会成本 ≈ 上网价(0.36–0.45),比市电(0.6–0.8)低 40% 左右,且午间负电价时段≈免费。
- 光伏出力的时间窗口:中山年等效利用小时约 1000–1100h(1MW 年发电约 100–110 万度),白天午间为发电高峰,把微调、批量生成、数据蒸馏这类可中断任务排到午间,与 DeepSeek 峰谷定价是同一套逻辑 [63]。
- 夜间无光怎么办:推理是 7×24 业务,机柜需市电兜底或配储能;可先用光伏电做"边际产能",市电做保底,避免电力配额成为瓶颈。
- 物理与合规前提:需核实园区变压器容量、并网容量、机房消防备案;中山属湿热气候,机柜散热建议液冷或加强空调,夏季 PUE 会偏高(全国超大型设施均值 1.34 [4])。
- 政策红利:广东是虚拟电厂与需求响应先行区,自备储能/可调负荷未来可参与现货套利;叠加报告 1.5 节的算力券政策可进一步降本 [15]。
附录 A:关键指标对比总表
A0. 2026 年 H1 最新数据速查(本版新增)
| 指标 | 数值 | 时点 | 来源 |
|---|---|---|---|
| 英伟达单季营收 | $816 亿(+85%);数据中心 $752 亿(+92%) | FY27Q1(2026-05 发布) | NVIDIA 官方 [64] |
| 北美四大云 capex | 单季 $1,316 亿(+70%);2026 全年指引约 $7,100 亿;2027 预计超 $1 万亿 | 2026Q1 | 各公司财报/券商整理 [67] |
| 中国智能算力规模 | 1,882 EFLOPS(FP16) | 2026Q1 | 信通院 [66] |
| 中国 AI 算力需求增速 | +417%(供给仅 +128%) | 2026Q1 | 信通院 [66] |
| DeepSeek-V4 输出价 | 高峰 ¥27 / 闲时 ¥13.5(较此前 ¥6 涨 350%) | 2026-08-17 生效 | DeepSeek 官方 [63] |
| H100 租赁价变动 | 年初至今 +20%;A100 +15% | 2026H1 | 英伟达 CFO 电话会 [65] |
| 中国算力网投资 | "十五五"新增直接投资 4 万亿元;首个全国产十万卡集群落地郑州 | 2026 | 国家发改委/华夏时报 [68] |
| Token 日消耗量 | OpenAI 日调用 21.6 万亿词元;豆包日调用超 120 万亿词元 | 2026 | 信通院 2026 报告 [70] |
A1. 市场规模与增速
| 指标 | 数值 | 年份/时点 | 来源 |
|---|---|---|---|
| 全球数据中心系统支出 | $5,060 亿(+51.6%)→ $8,220 亿(+62.5%) | 2025 实际 → 2026E | Gartner 2026-07 [78] |
| 全球 AI 基础设施支出 | $474 亿(+97%,半年)→ 2028E $2,230 亿 | 2024H1 → 2028E | IDC [3] |
| 全球 AI 推理市场 | $1,061.5 亿 → $2,549.8 亿(CAGR 19.2%) | 2025 → 2030E | MarketsandMarkets [6](Grand View 口径相近 [57]) |
| 中国智能算力市场 | $190 亿(+86.9%) | 2024 | IDC(信通院引用)[58] |
| 中国智算规模 | 49.3 万 PFLOPS → 159 万 PFLOPS(FP16),全球第二 | 2024 末 → 2025 末 | 国家数据局 [4] |
| 全国万卡级智算集群 | 42 个;智算中心超 250 个 | 2025 | 国家数据局 / 信通院 [4][14] |
| 全球大模型数量 | 3,755 个(中国 1,509 个 / 40.2%) | 2025-06 | 信通院 [59] |
| 超大规模云 capex | $2,590 亿 → $4,140 亿 → $5,310 亿(预计) | 2024 → 2025 → 2026E | Bloomberg / Guinness GI [60] |
A2. Token 成本与定价
| 指标 | 数值 | 时点 | 来源 |
|---|---|---|---|
| GPT-3.5 级推理成本降幅 | $20 → $0.07/百万 token,降 280 倍 | 2022-11 → 2024-10 | Stanford AI Index 2025 [7] |
| GPQA>50% 模型推理成本降幅 | $15 → $0.12/百万 token,降 125 倍 | 2024-05 → 2024-12 | Stanford AI Index 2025 [7] |
| GPT-4o-mini API 价 | $0.15 / $0.60(输入/输出,百万 token) | 2024-07 | OpenAI 官方 [61] |
| DeepSeek-V3 API 价 | $0.27 输入(缓存未命中)/ $1.10 输出 | 2024-12 | DeepSeek 官方 [62] |
| DeepSeek-R1 API 价 | ¥4 输入(未命中)/ ¥16 输出 | 2025-01 | DeepSeek 官方 [38] |
| B200 vs H100 单 Token 成本 | 降 20 倍;吞吐 21,088 vs 844 tok/s | 2025-02 | 英伟达官方 [8] |
| H100 云租价 | $7–10 → $2–4/卡时(峰值跌 60%+) | 2023 → 2025 | Silicon Data / wiki 汇总 [9] |
| 自建 8 卡 H100 单 Token 成本 | 约 ¥2.3/百万(70% 利用率,估算) | 2026 测算 | 本报告测算模型(2.5 节) |
A3. 硬件核心指标速查
| 指标 | Mac mini M4 Pro 64GB | Mac Studio M3 Ultra 512GB / M4 Ultra 192GB | A100 80GB | H100 SXM5 | H200 SXM | B300(2026 主力) |
|---|---|---|---|---|---|---|
| 价格(2026) | $2,199(约 ¥1.6 万)[82] | $11,699 / ¥74,249(M3U)[34];M4U $1,999 起[77] | 云租 $0.66–4/时 [9] | $35–40K 新卡 [33] | $38–45K [44] | 约 $53K/卡;云租 $7.1–17.8/时 [75][76] |
| 内存/显存 | 64GB 统一内存 | 512GB / 192GB 统一内存 | 80GB | 80GB | 141GB | 288GB |
| 带宽 | 273GB/s | 819 / 800GB/s | 2.04TB/s | 3.35TB/s | 4.8TB/s | 8TB/s |
| 70B 生成速度 | 9–11 tok/s(单用户)[82] | 15–30 / 20–35 tok/s(单用户)[48][77] | ≈56 tok/s 单流 [50] | 120 tok/s 单流 / 2,400 tok/s @100 并发 [17] | ≥H100(KV 更足)[37] | 高并发超 H100(带宽 2.4×) |
| 最大模型承载 | 70B Q4(紧) | 671B Q4(M3U)/ 100B 级(M4U)[51][77] | 70B FP8(紧) | 70B FP8 | 70B FP8 + 大 KV [37] | 单卡 200B+ [75] |
| 功耗 | 65–100W | ≈215 / ≈200W 实测 [52][77] | 400W | 700W | 700W | 1,400W(液冷必选) |
| 扩展性 | TB5 | TB5 菊花链(实验)[54] | NVLink 900GB/s + InfiniBand 400Gb/s(生产级)[41] | NVLink 5 / GB300 NVL72 机架 [75] | ||
A4. 投入规划速查
| 阶段 | 时间 | 预算(标准档) | 关键里程碑 | 退出/止损条件 |
|---|---|---|---|---|
| 前期(验证) | 0–6 月 | 150–350 万 | M1 技术跑通;M3 种子客户;M6 决策评审 | M6 利用率 <40% → 转纯云策略 |
| 中期(扩容) | 6–18 月 | +300–800 万 | M9 双集群;M12 ≥30 客户;M18 盈亏平衡 | M18 未平衡 → 聚焦高毛利客户 |
| 后期(规模化) | 18–36 月 | 1,000–3,000 万 | M24 ROI 转正;M30 西部节点;M36 千亿 Token/月 | — |
附录 B:完整数据来源列表
编号与正文上标 [n] 一一对应。数据检索与核实时间:2026 年 8 月。部分来源为二手转载(已在正文标注),建议关键决策数据以一手来源为准。
官方机构与权威报告(一手来源)
- [1] Gartner:Worldwide IT Spending to Grow 7.9% in 2025(2025-07)
- [2] Gartner / CIO.com:AI 优化服务器支出超传统服务器(2025-07)
- [3] IDC:AI Infrastructure Spending Press Release(2025-02-18)
- [4] 国家数据局:《数字中国发展报告(2025年)》(2026-06 发布;转载:digitalchina.gov.cn)
- [5] Gartner:2028 年 80% 数据中心加速器用于推理(2025 年预测,经 AAAI 2026 论文引用)
- [6] MarketsandMarkets:AI Inference Market(2025-02);[57] Grand View Research:AI Inference Market Report(2025-05)
- [7] Stanford HAI:AI Index Report 2025(与 Epoch AI 合作)
- [11] NVIDIA:FY2025 Q4 & Full Year Results(2025-02-26)
- [12] NVIDIA FY2026 财报(2026-02,经 21 世纪经济报道转载:报道链接)
- [14] 中国信通院:《2025 综合算力指数》(2025 中国算力大会);[59] 《综合算力指数蓝皮书(2025年)》:PDF
- [16] Apple Newsroom:Mac Studio M3 Ultra 发布(2025-03-05,512GB 统一内存 / 6000 亿参数)
- [22] 工信部等六部门:《算力基础设施高质量发展行动计划》(2023-10)
- [24] AMD:2025 Q3 财报(2025-11-04,OpenAI 6GW 合作)
- [26] 观点网/深圳发布:全国首个万卡昇腾 910C 超节点(故障率 0.3‰)
- [27] 寒武纪 2025 年度业绩快报(2026-02-27,营收 +453%):上海证券报
- [38] DeepSeek 官方 API 文档:R1 发布与定价(2025-01-20,¥4/¥16);[62] V3 定价($0.27/$1.10)
- [58] IDC《中国人工智能计算力发展评估报告》2024 数据(经中国信通院《人工智能算力基础设施赋能研究报告(2025年)》引用)
- [61] OpenAI 官方 API 定价(GPT-4o-mini $0.15/$0.60,2024-07)
行业研究与媒体来源(可核实,部分为转载)
- [8] 证券时报:英伟达发布 DeepSeek-R1-FP4,B200 单 Token 成本降 20 倍(2025-02-25)
- [9] artificial-intelligence-wiki:GPU Cloud Comparison 2025(各云公开标价汇总);Silicon Data:H100 Rental Price Over Time
- [10] RBC BlueBay 研报转载 Morgan Stanley 电力数据:AI: Paradigm Shift or Bubble(2025)
- [13] IDC 中国 AI 加速卡出货数据(经行业报告转载:2025 年中国 AI 芯片格局;昇腾 81.2 万颗:报道)
- [15] 南方财经 21 世纪经济报道:深圳模型券与地方算力补贴政策(2025-07)
- [17] cloudai.pt:vLLM vs TensorRT-LLM vs SGLang H100 基准(2026,H100 70B 100 并发 2,400 tok/s)
- [18] GMI Cloud:H100 2025 Buy vs Rent(盈亏平衡 60–70% 利用率;厂商口径);[36] gpu.fm:GPU Server Pricing Guide(20 个月回本)
- [19] sparkco.ai:华为云 10MW 智算中心 TCO 模型(CAPEX $48.3M/MW,ROI 4.2 年 / 优化 3.1 年;模型化测算)
- [20] Bancara:AI CapEx 与泡沫争论综述(含美银 54% 调查);[32] remio.ai:纳德拉"芯片插不上电"发言
- [21] 光明网:H20 芯片解禁怎么看(2025-07,含 55 亿美元减值)
- [23] aitooldiscovery:Hyperscale Data Center Cost(Turner & Townsend 指数 $10.7M/MW);[35] aicerts(美银估算):全口径 $37.6–38M/MW
- [25] kocka.news:昇腾 910C 技术分析(推理约为 H100 60%)
- [28] IDC 中国 AI 加速卡市场(2025 出货 400 万张、英伟达 55.22%、国产首破 40%,经券商行业报告转载)
- [29] 虎嗅:数据中心电价与选址分析;财联社:"Token 之都"乌兰察布(电价 0.35 元/度)
- [30] 21 世纪经济报道:美国 2024-12 对华半导体管制升级(含 HBM)
- [31] 摩根大通芯片自给率测算(34% → 2027E 82%,经光明网 2025-07 引用)
- [33] RunPod:NVIDIA H100 价格指南(新卡 $35–40K、二手 $6–22K、2023 峰值 $80–120K);[43] GMI Cloud / gpu.fm:云租价汇总
- [34] 新浪财经:Mac Studio M3 Ultra 512GB 国行售价 ¥74,249 / ¥108,749(2025-03)
- [37] aitechconnect:vLLM 生产部署手册(70B FP8 ≈70GB、H200 替代 2×H100)
- [39] startups.com:Inference Cost 行业综述(推理成本占营收 25–30% 经验值)
- [40] computingforgeeks:统一内存 vs 显存(推理带宽瓶颈分析)
- [41] gpusmith:NVIDIA 数据中心 GPU 规格对比;[45][46] ima.qq(AIDC 行业研究转载):H200 $38–45K、DGX 整机 $250–460K
- [42] Macworld:Mac Pro 2023 定价;[55] 新浪:Mac Pro 停产(2025)
- [44] cyfuture.cloud:H200 渠道价 $45–50K(2025 年中)
- [47] Apple Newsroom HK:Mac Studio / Mac Pro M2 Ultra(800GB/s)
- [48] insiderllm:Mac Studio 本地 AI 实测(M3 Ultra 70B Q4:25–30 tok/s)
- [49] willitrunai:M2 Ultra 128GB 跑 70B(估算模型,非实测);[50] aitot.net 推理基准(估算模型)
- [51] specpicks:M3 Ultra vs RTX 5090(671B Q4 18 tok/s、每瓦性能对比)
- [52] thinkdifferent.blog:Mac Studio 功耗实测(待机 ~10W / 负载 150–270W)
- [53] specpicks:M3 Ultra 70B 每瓦性能 0.065 tok/s/W 推算
- [54] Jeff Geerling:1.5TB VRAM on Mac Studio(RDMA over Thunderbolt 5,2025-12)
- [56] AppleInsider:Mac 集群 RDMA 评测(Qwen3 235B 31.9 tok/s、局限分析)
2026 年最新数据来源补充
- [63] DeepSeek 官方:V4 全系 API 峰谷定价公告(2026-08-13 发布,8-17 生效;南都·湾财社);澎湃新闻:V4 定价上调详情(V4-Pro-0813 发布)
- [64] NVIDIA:FY27Q1 财报(2026-05-20,营收 $816 亿 / 数据中心 $752 亿);财报电话会实录("Token 现在能够盈利")
- [65] 上海证券报/中国证券网:英伟达 FY27Q1 报道(2026-05-22,H100 租价 +20%、A100 +15%、Vera Rubin 计划)
- [66] 中国信通院何宝宏(CCTV 采访):2026Q1 中国智能算力 1,882 EFLOPS 与算力网建设(2026-06);华夏时报(2026-08):2026Q1 算力需求 +417% vs 供给 +128%
- [67] 中信建投:北美四大 CSP 2026Q1 资本开支合计 $1,316 亿(+70%)、全年约 $7,100 亿(2026-05);兴业证券(2026-05):谷歌/微软全年 capex 增速 102%/129%
- [68] 华夏时报:"十五五"算力网 4 万亿投资、政治局"六张网"、郑州十万卡集群、庆阳集群 185.5 EFLOPS(2026-08)
- [69] IDC:2026 年中国智能算力规模预测 1,460.3 EFLOPS(为 2024 年两倍;华夏时报/今日头条 2026-08 引用)
- [70] 中国信通院:《智能算力服务研究报告(2026年)》(2025 年中国智能算力服务市场超 1,300 亿元、全球 AI 优化服务器市场 $2,800 亿、OpenAI 日调用 21.6 万亿词元、豆包日调用超 120 万亿词元;川观智库快讯转载)
- [72] 广东省发改委/省能源局:《关于公布 2025 年新能源项目机制电价竞价结果的通知》(粤发改价格函〔2025〕2137 号,分布式光伏机制电价 0.36 元/kWh);人民日报:广东推进新能源上网电价市场化改革(2026-01)
- [73] 21 世纪经济报道:大湾区分布式光伏:全面入市、负电价、2026 年度交易均价下限 0.372 元/kWh(2026-07)
- [74] 中山光伏行业数据(行业媒体口径,供参考):年等效利用小时约 1000–1100h、2025 年分布式光伏新增备案超 300MW(链接)
- [75] NVIDIA B300/DGX B300/GB300 规格与价格:DGX B300 对比表;B300 单卡 $53K / 288GB HBM3e / 8TB/s(2026)
- [76] B300 云租价与供货:$7.1–17.8/卡时(2026-08);预留 $5.65/时、TDP 1400W;百度爱企查:B300 2026 年初出货、7 月向客户交付
- [77] Apple Mac Studio M4 Ultra 与 Mac Pro 停产:M4 Ultra 规格(192GB 统一内存、80 核 GPU);Mac Pro 2026-03 正式停产;统一内存对比(M4 Ultra 约 200W 跑 671B)
- [78] Gartner:Worldwide IT Spending to Grow 14.2% in 2026(2026-07-27,数据中心系统 2025 实际 $506B/+51.6% → 2026E $822B/+62.5%);2026-04 版(2026E $788B/+55.8%)
- [79] OpenAI 用户与 API 数据(2026):The Information《OpenAI's ChatGPT Nears 1 Billion WAU》(2026-07-28,周活 9 亿→近 10 亿);Reuters:ChatGPT 周活 9 亿(2026-02)、月活超 10 亿(2026-06);axis-intelligence:API 150 亿 tokens/分钟(2026-03)
- [80] AMD:2026Q1 财报(2026-05-05,数据中心 $58 亿 +57%;Meta 6GW 合作;MI450 下半年量产)
- [81] Polaris Market Research:AI Inference Market(2026-04,2025 $1,060 亿 → 2026E $1,262 亿,CAGR 19.4%)
- [82] Mac mini M4 Pro 规格与推理实测:64GB/273GB/s、70B Q4 约 9–11 tok/s(2026);价格阶梯:M4 $599 / M4 Pro 24GB $1,399 / 48GB $1,799 / 64GB $2,199;2026 年 mini 主机 LLM 对比(70B 9–11 tok/s)
补充来源(正文涉及但未编号)
- OpenAI 历史里程碑(供对比):DevDay 2025(2025-10)ChatGPT 周活 8 亿 / API 60 亿 tokens/分钟(腾讯新闻转载);最新数据见 [79](2026 年周活 9 亿+、API 150 亿 tokens/分钟)
- Anthropic:Claude 4 系列官方定价(官方公告)
- Global Market Insights:AI Data Center Market(2025-11);Fortune Business Insights:AI 数据中心市场(口径较窄)
- 中国经营报:DeepSeek 掀新一轮 API 降价潮(2025-02,含 2024 年价格战回顾)
- 界面新闻/新浪财经:DeepSeek 夜间错峰降价 50–75%(2025-02-26)
- 中国 IDC 圈:全国智算中心超 250 个(2025-08)
- Kings Research:AI Inference Market(2024 $983.2 亿 → 2032E $3,783.7 亿)
- IIM 信息研究网:按 Token 计费占比 71%(中国咨询机构调研口径,可靠性中等)
- Guinness Global Investors(Bloomberg 数据):超大规模云 capex 追踪(2025-11)
- 研精毕智"词元经济"报告(口径激进,仅概念参考):链接
数据质量分级说明
- 一级(高可信)官方财报/官方 API 定价/政府报告/国际权威机构(Gartner、IDC、斯坦福 HAI、信通院、国家数据局),正文主引用。
- 二级(可核实)权威媒体与专业网站(21 财经、证券时报、媒体转载 IDC 数据、cloudai.pt 等基准站),已在正文标注转载属性。
- 三级(谨慎)厂商自营博客(GMI Cloud、ertas、Ariax 等,营销立场)、估算模型站(willitrunai、aitot)、中国咨询机构营销页(研精毕智、IIM),仅作趋势/框架参考,不单独支撑结论。