只属于你的聊天机器人
在无人共用的服务器上运行 Llama、Qwen 或 Mistral 等开放模型。提示词、文档和回答都留在你的机器上,而不是发往别人的 API。
它现在擅长什么
在无人共用的服务器上运行 Llama、Qwen 或 Mistral 等开放模型。提示词、文档和回答都留在你的机器上,而不是发往别人的 API。
700 亿参数的模型以 4-bit 精度就能装进一张解锁卡。在未解锁的卡上,上限大约是 80 亿参数的模型。
模型用不完的显存都会留给上下文,因此长文档和长对话可以持续进行,不会中途耗尽空间。
聊天模型、用于搜索的嵌入模型,以及负责路由请求的小模型可以同时加载,而不必轮流占用。
按月一口价,卡和带宽都不按量计费。让一批任务跑整个周末,账单也不会变动。
仅计算权重,并额外留出四分之一到一半的空间给对话本身。完整的选型指南见我们的 LLM 页面。
同一张卡,解锁前后
LTT Labs 在 2026 年 9 月解锁了一块 CMP 170HX,并用两种方式在上面运行了相同的模型。这些是他们的结果,不是我们的。速度会因模型和软件而异,所以请把它们看作提升的幅度,而不是我们要你死守的数字。
这些数字来自 LTT Labs 2026 年 9 月的评测文章,他们在自己的测试机上运行了 llama.cpp。解锁工具本身是 cmpunlocker,一个由 Amogh Munikote 开发的开源项目。
下单之后会发生什么
在配置器中选择 Ubuntu 22.04、24.04 或 26.04。解锁功能是一个 Linux 驱动程序,因此这是唯一重要的选择。
显卡装入服务器,安装 Ubuntu,并将解锁驱动程序内置到系统中,精确匹配您服务器将要运行的内核。
服务器会完全关机再重新启动,这正是解锁所需的过程,并且每块显卡都会在交付前检查其全部显存。
当 Ubuntu 安装新内核时,驱动程序会自动重新构建以匹配。随时输入 cmp-unlock status 即可查看每块显卡的运行状态。
购买前值得了解
费用说明
显卡在账单上单独列一行,服务器另列一行,这样每一项的费用都一目了然。所示价格为最小规格服务器中单张显卡的费用。在配置器中增加内存、更大硬盘或更多显卡时,总价会随之实时更新。
由于显卡需按订单安装,因此收取一次性设置费。带宽不限流量,美国销售税在结账时按适用情况加收,续费时月费保持不变。
$272.67/month
Intel Xeon Silver 4110 8 Core 2.10 GHz · 16 GB DDR4 · 2 × SATA-SSD 240 GB (RAID 1) · 1 Gbps
常见问题
NVIDIA 将 CMP 170HX 作为挖矿卡出售,并在软件层面关闭了大部分功能:它只显示 8 GB 显存,浮点运算速度极慢。一个名为 cmpunlocker 的社区驱动会重新开启这些功能。解锁后的显卡拥有 64 GB 显存,并以芯片本身的性能运行,该芯片与 A100 相同。
8 GB 版本的显卡解锁后为 64 GB,你可以在 nvidia-smi 中看到。10 GB 版本解锁后为 40 GB,因为超过这个容量在该版本上不够稳定。如果没有解锁驱动,两者都只显示出厂时的显存容量。
不需要。订购服务器时选择 Ubuntu 22.04、24.04 或 26.04,交付时即已解锁。我们会安装驱动、为你的内核构建解锁模块,并在交付前逐一检查每张显卡。
会的。解锁驱动会在服务器每次启动时加载,当 Ubuntu 安装新内核时,解锁模块会自动为新内核重新构建。如果某张显卡显示 8 GB,请从控制面板关闭再开启服务器,若问题仍未解决请告知我们。
任何为 NVIDIA 显卡开发的软件:PyTorch、llama.cpp、Ollama、vLLM 等等。使用 apt install cuda-toolkit 安装 CUDA 工具包。请避开名为 cuda 和 cuda-drivers 的软件包,它们会添加第二个驱动;我们已将服务器设置为拒绝安装这些包。
可以,但解锁仅适用于 Linux,因此在 Windows 上显卡仍保持 8 GB 及原始限制。对于任何需要大显存的任务,请选择 Ubuntu。
最多四张。两张解锁显卡合计拥有 128 GB 显存,足以在 8-bit 精度下运行 700 亿参数的模型。
可以,解锁不会移除任何功能。不过,如果挖矿是主要计划,我们的挖矿页面介绍了相关显卡和成本。
显卡是根据你的订单安装的,这使得服务器成为定制配置,而定制配置会收取一次性设置费。该费用只收取一次,续费时月费不会上涨。