提示词永不离开大楼
权重、提示词、检索到的文档和每一个生成的 token 都只留在只有您能登录的硬件上。阿姆斯特丹或布加勒斯特,数据就留在欧盟;纽约、迈阿密或旧金山,数据就留在美国。对于要向隐私官交代的工作负载,这句话就是整个商业论证。
选型工作表 · 裸机上的语言模型 · 始于 2004
从上往下填写,就像做决定的过程一样:模型决定权重,精度对权重进行缩放,余量覆盖运行时和对话,总数决定用哪张卡。订单表单上其他任何选项都不会改变这个答案 — 一张少两 GB 显存的卡不会跑得慢,它根本加载不了。
工作表
70B: 38 GB × 1.5 = 57 GB
Smallest card on the schedule that clears it (3 larger ones also do):
Instinct MI21064 GB HBM2eThe link opens the machine it goes in. What it costs is on /gpu — not on this sheet.
第 1 行 × 第 2 行是权重;第 3 行是本网站公布的“四分之一到一半”余量规则,以算术形式表达 — 在 llama.cpp 或 Ollama 上一次服务一个用户,再加四分之一;在 vLLM 或 TGI 上以连续批处理服务流量,再加一半。结论会给出订单目录中能容纳这个总数的最小显卡,并链接到它所安装的机器。那台机器的价格刻意不写在本页上:所有数字都在 /gpu 上,对应它所属的确切机器。
图 1
参数量乘以每个参数的字节数,这就是全部计算。十六位权重每个两字节,八位每个一字节,四位每个半字节。量化就是把一台装不下模型的机器变成装得下的机器;它要付出质量代价,而代价多大,更多取决于模型和方法,远不止位数本身。如果精度是这件事的目的,在确定硬件之前两种都测一下 — 现在发现差异比交货后再发现便宜得多。
这些数字只是权重,不含其他任何东西。它们是下限,不是要求 — 图 2 才是让人栽跟头的部分。
| Model | 16-bit | 8-bit | 4-bit |
|---|---|---|---|
| 7-8 billion parameters | 16 GB | 8 GB | 5 GB |
| 13-14 billion parameters | 28 GB | 14 GB | 8 GB |
| 30-34 billion parameters | 68 GB | 34 GB | 19 GB |
| 70 billion parameters | 140 GB | 70 GB | 38 GB |
图 2 · 交互式
GPU 采购出错最常见的方式,每次都是同一种:模型三十八 GB,显卡四十 GB,它加载了 — 然后大约只能进行一段很短的对话。权重在里面并不是独自存在的。拖动工作负载,看看对话会怎样。
单用户,短上下文:紧凑乘数(×1.25)覆盖这种情况。
图 3
向下找到您的模型,横向找到精度。每个单元格都会给出零件清单上能容纳这些权重并留有服务余量的最小显卡,并链接到它所安装的机器。如果没有任何单卡能容纳,单元格会明确说明,而不是留空。
| If you want to run | at 16-bit | at 8-bit | at 4-bit |
|---|---|---|---|
| 7-8 billion parameters | TESLA P40 / QUADRO P600024 GB16 GB of weights | TITAN V12 GB HBM28 GB of weights | TESLA P48 GB GDDR55 GB of weights |
| 13-14 billion parameters | RTX A600048 GB GDDR6 ECC28 GB of weights | TESLA P40 / QUADRO P600024 GB14 GB of weights | TITAN V12 GB HBM28 GB of weights |
| 30-34 billion parameters | More than one cardNothing we fit holds it alone68 GB of weights | Instinct MI21064 GB HBM2e34 GB of weights | Tesla V100 32GB32 GB HBM219 GB of weights |
| 70 billion parameters | More than one cardNothing we fit holds it alone140 GB of weights | More than one cardNothing we fit holds it alone70 GB of weights | Instinct MI21064 GB HBM2e38 GB of weights |
清单 A
从最大开始 — 这一页回答“我能运行的最大东西是什么”,与 GPU 独立服务器相反,后者按最便宜的整机对同一目录排序,因为它回答的是“这要花多少钱”。制造商未公布显存的显卡会被排除,而不是猜测。
有几款零件出现在不止一个机箱上,有时价格不同,而且底层机器的总线代际会影响现代显卡实际能做什么 — 两者都在 GPU 独立服务器上。此刻已上架并随时可用的又是另一个问题,由即时服务器回答。
参考
人们带到这里的开放权重系列,附发布方公布的参数量,它决定图 1 中哪一行适用。参数量是发布方自己的数字;模型的其他任何方面都与适配问题无关。不在这个列表上的模型,选型方式完全一样 — 参数量 × 每参数字节数,再加余量。新系列每月发布;算术不会变。
注 1 · 混合专家
一个“30B 参数、3B 激活”的模型需要 30B 模型的显存,运行速度接近 3B 模型的速度:每个专家都必须驻留,因为不同的 token 会唤醒不同的专家。始终按总参数量来选型。
| 系列 | 规模 | 行 |
|---|---|---|
| Llama 3.1 / 3.3 Meta | 8B · 70B | 7–8B,3.3 版本为 70B |
| Qwen3 阿里巴巴 | 8B · 14B · 32B | 前三行 |
| DeepSeek-R1 蒸馏版 | 7B – 70B | 每行一个 — 选您的卡能装下的那个蒸馏版 |
| Mistral Small 3 Mistral AI | 24B | 在第 2 行和第 3 行之间;按算术选型,不要按标签 |
| Gemma 3 Google | 12B · 27B | 第 2 行,以及略低于第 3 行 |
| Phi-4 Microsoft | 14B | 第 2 行 |
| gpt-oss OpenAI | 20B · 120B | 原生以 4 位发布:一张 16 GB 卡,以及一张 80 GB 卡 |
安装说明
机器交付时带有干净的操作系统和 root 权限。模型前面没有厂商推理服务,也没有会在截止日期前一周自行升级的托管运行时。vLLM 和 Ollama 都在 OpenAI 兼容端点上应答 — 针对某个 API 提供商编写的代码,只需改一个基础 URL 就能指向您自己的机器。把驱动、CUDA 或 ROCm 版本以及框架固定到您的代码测试过的版本;您脚下不会有任何东西变动。如果您希望在交付前装好驱动,请在订单上说明并指定版本。
现场条件
权重、提示词、检索到的文档和每一个生成的 token 都只留在只有您能登录的硬件上。阿姆斯特丹或布加勒斯特,数据就留在欧盟;纽约、迈阿密或旧金山,数据就留在美国。对于要向隐私官交代的工作负载,这句话就是整个商业论证。
按 token 计费的 API 对每个 token 收费,而一个智能体或批处理流水线整天都在生成 token。专用机器在任何流量下每月都是同一个数字,底下还有不限流量带宽 — 权重进、token 出,除了端口之外不花一分钱。这个数字是多少,是 /gpu 那一页要填的,不是本页的。
您固定的模型六个月后原样应答。没有每分钟请求上限,没有在别人高峰时段排队,没有停用通知。这笔交易是诚实的:升级是您的事,按您的时间表来。
检索需要嵌入模型、向量存储和快速磁盘;智能体需要运行工具的空间。NVMe 给存储,处理器核心给流水线,显卡给 token — 一台机器承载全部。
注 2 · 性能指标
这是刻意的。每一个这样的数字都取决于模型、量化、运行时及其版本、批大小、提示长度、回复长度和并发 — 改变其中任何一个,它都会成倍变动。一个不附带所有这些条件的头条数字,就是一个为了好看而选的数字,而我们会被引用。决定它的是什么:读取提示是计算受限的,每个请求发生一次;生成回复是显存带宽受限的,因为每个 token 都需要读取权重;批处理把这次读取分摊到并发请求上,直到键值缓存耗尽空间。又是余量。
告诉我们模型、您打算用的量化、上下文长度以及大致多少并发请求。如果我们跑过类似的东西,我们会说看到了什么、在什么上看到的。如果我们没跑过,我们也会直说。
每天每时每刻 — 电话、聊天和工单。支持页面有书面承诺的响应时间。
注 3 · 微调
服务只需要权重。训练需要权重、梯度以及每个被更新参数的优化器状态,全部同时驻留,再加上为反向传播保留的激活值 — 一个在一张卡上舒适服务的模型,要在这张卡上完整微调,可能大出好几倍。参数高效方法只更新一小部分参数,因此只需要相应一小部分的额外显存,这就是这里大多数微调都采用这类方法的原因。训练循环还会持续通过处理器到显卡的链路流式传输批次,所以底层机器的 PCIe 代际在那里是真正的约束,而在服务场景中并非如此 — 哪个平台给哪张卡什么链路,在 GPU 独立服务器上。告诉我们模型、方法、序列长度和数据集大小,我们会帮您选型,而不是让您在交货后才发现;多卡是 多 GPU 和多节点那一页的内容。
相邻页面
本页只负责一个问题:运行一个模型需要什么。相邻的一切都有自己的页面,这里就是全部。
提出的疑问
取自人们在聊天和工单中实际向我们提出的问题,大致按提问顺序排列。前三个问题决定了购买是否可行。
For the record
Card memory is the manufacturers’ published figure; which cards exist is read from the order catalogue when this page was served. No monthly price appears here on purpose — GPU dedicated servers holds every one, against the exact machine it belongs to.