vLLM
通常情况下,向真实流量展示模型需要采用连续批处理和分页式注意力机制。这使得一张卡片可以同时响应多个请求,而不是一次只能响应一个,这通常是演示和服务之间的区别。需要一张比较现代的卡片。
基于裸机的语言模型 · Primcast LLC · 自 2004 年起
人们来到这个页面时,以为要做的就是选择速度最快的加速卡。其实不然。模型权重要么能装进显卡内存,要么装不下——少了2GB内存的显卡运行速度不会变慢,而是根本无法加载。所以,这个页面的顺序才是真正做决定的顺序:模型有多大,运行精度是多少,计算需要多少空间,最后才确定哪张显卡符合要求。价格信息特意放在下一页。
每台机器仅限一个租户。该卡会直接传递给您的操作系统,您可以自行选择并固定运行时、驱动程序和框架版本。
第一步
参数数量乘以每个参数占用的字节数,这就是全部计算结果。16 位权重每个占两个字节,8 位权重每个占一个字节,4 位权重每个占半个字节。一个 70 亿参数的 16 位模型需要 14 GB 的权重;同样的 4 位模型则需要 3 到 4 GB 的权重。
量化可以将原本无法存储模型的机器变成可以存储模型的机器。它会降低精度,而精度降低的程度远取决于模型和量化方法,而不仅仅是位数——一个量化良好的四位模型通常比人们预期的更接近其全精度状态,而一个量化不良的八位模型则可能更差。如果精度是关键,那么在投入硬件之前,应该对两种方法都进行测试;现在发现差异的成本远低于交付后发现差异的成本。
这些数字只是权重,仅此而已。它们是底线,而非要求。下一部分才是最容易让人困惑的地方。
| Model | 16-bit | 8-bit | 4-bit |
|---|---|---|---|
| 7-8 billion parameters | 16 GB | 8 GB | 5 GB |
| 13-14 billion parameters | 28 GB | 14 GB | 8 GB |
| 30-34 billion parameters | 68 GB | 34 GB | 19 GB |
| 70 billion parameters | 140 GB | 70 GB | 38 GB |
第二步
这是购买 GPU 时最常见的出错方式,而且每次出错的方式都一样:有人看到自己想要的型号是 38 GB,就买了一张 40 GB 的显卡,安装成功后,却发现它只能勉强进行一次简短的对话。
加载模型并不是占用内存卡的唯一内容。运行时本身、其缓冲区以及正在计算的任何内容的激活值都与权重一起驻留在同一内存中。
对话中已存在的每个令牌都会在键值缓存中留下一些信息,这样就无需重新计算。缓存会随着上下文长度的增长而增长,也会随着同时处理的请求数量而增长。较长的上下文或繁忙的端点可能需要与小型模型一样多的内存。
卡片内存的预算至少要比权重多四分之一,如果上下文时间较长或端点繁忙,则至少要多预留一半。下一节表格中的规则就是如此——表格中列出的每张卡片都存储着权重的1.5倍。
请告诉我们您需要的模型、量化级别、上下文长度以及大致的请求数量。我们宁愿现在就说服您选择容量更大的卡片或更小的模型,也不愿接受一个第一周就令人失望并导致退款的订单。
第三步
向下读取至您的型号尺寸,横向读取至您计划使用的精度。每个单元格都列出了我们能容纳这些重量且仍有剩余空间的最小卡片,并链接到相应的机器。如果目录中没有可单独使用的产品,则该单元格会注明,而不是留空。
| If you want to run | at 16-bit | at 8-bit | at 4-bit |
|---|---|---|---|
| 7-8 billion parameters | TESLA P40 / QUADRO P600024 GB16 GB of weights | TITAN V12 GB HBM28 GB of weights | TESLA P48 GB GDDR55 GB of weights |
| 13-14 billion parameters | RTX A600048 GB GDDR6 ECC28 GB of weights | TESLA P40 / QUADRO P600024 GB14 GB of weights | TITAN V12 GB HBM28 GB of weights |
| 30-34 billion parameters | More than one cardNothing we fit holds it alone68 GB of weights | Instinct MI21064 GB HBM2e34 GB of weights | Tesla V100 32GB32 GB HBM219 GB of weights |
| 70 billion parameters | More than one cardNothing we fit holds it alone140 GB of weights | More than one cardNothing we fit holds it alone70 GB of weights | Instinct MI21064 GB HBM2e38 GB of weights |
如果答案是“多张显卡”,我们会提供相应的配置报价,而不是直接下单购买。多GPU和多节点页面会详细解释这种配置的具体情况和限制。每张显卡的月租金以及其所在服务器的费用都属于GPU专用服务器的范畴——所有费用都与它所属的特定服务器相关,因此本页面不会重复列出。
凭记忆,最大的排在第一位
同样的目录,GPU页面的价格排序方式正好相反:GPU页面从最便宜的整机开始,因为它回答的是“这台机器多少钱”,而这个页面从性能最强的显卡开始,因为它回答的是“我能运行的最大配置是什么”。如果显卡的显存容量没有厂商公布,那么这个页面会将其省略,而不是显示空白,因为无法比较的行对比较毫无意义。
这些显卡有好几种,其中一些出现在不止一种机箱上,价格有时也不同,而且底层机器的总线代数也会影响现代显卡的实际性能——这些都与GPU专用服务器有关。至于哪些显卡已经安装完毕并随时可用,则是另一个问题,答案是即时服务器。
你在上面安装什么
这台机器出厂时已预装干净的操作系统并拥有 root 权限。您无需使用任何厂商推断服务,无需担心托管运行时会在截止日期前一周自动升级,也无需访问您自己的模型 API。您可以根据需要安装所需的软件,并将其锁定到代码测试所用的版本。
通常情况下,向真实流量展示模型需要采用连续批处理和分页式注意力机制。这使得一张卡片可以同时响应多个请求,而不是一次只能响应一个,这通常是演示和服务之间的区别。需要一张比较现代的卡片。
当内存不足或存储卡较旧时,这通常是最佳解决方案。它的量化格式使得大型模型能够装入小容量存储卡,而且当权重数据无法完全匹配时,它也能很好地利用处理器和存储卡的协同工作。虽然每次请求速度较慢,但容错率更高。
生产服务器与 vLLM 属于同一系列,但在结构化输出、前缀重用和多模型服务方面各有优势。如果您的技术栈中已经部署了此类服务器,则无需任何修改即可直接运行。
从一台空机到一台正在接听电话的机型的最短路径。即使最终你选择了其他机型,也值得从这里开始,因为它会在大约十分钟内告诉你你的选择是否正确。
无论您选择哪种方案,驱动程序、CUDA 或 ROCm 版本以及框架构建都由您决定,不会在您未指定的情况下进行任何升级。如果您希望在交付前安装驱动程序,请在订单中注明并指定版本。
速度会有多快?
每个这样的数字都取决于模型、量化方式、运行时及其版本、批处理大小、提示符长度、回复长度以及正在进行的请求数量。任何一个因素的改变都会导致该数字成倍变化。如果一个数字没有包含所有这些信息,那么它就只是为了好看而刻意挑选出来的,而我们却会被媒体引用。
我们将告诉你相关的规则,以便你可以自行判断:
请告诉我们您使用的模型、量化级别、上下文长度以及预计的并发请求数。如果我们之前运行过类似的测试,我们会说明测试结果以及测试平台。如果没有,我们也会说明。
它比基准图表更适合作为购买依据,而且只需大约一分钟即可完成。
常规支持服务涵盖所有渠道——电话、在线聊天和工单,全年无休。支持团队会以书面形式告知响应时间。
超越服务
以上所有内容都涉及推理模型的规模调整:输入权重,输出标记。训练或微调同一个模型则涉及不同的内存问题,而且差异不容小觑。
模型运行需要权重。训练则需要权重、梯度以及优化器自身针对每个更新参数的状态,所有这些都必须同时存在,此外还需要保留激活值以便反向遍历网络。一个能在单卡上流畅运行的模型,其规模可能大到无法在同一张卡上进行完全微调。
参数高效的方法——例如适配器算法、低秩更新及其量化变体——只需更新一小部分参数,因此所需的额外内存也相应较少。对于大多数人们所说的微调任务而言,这既是切实可行的选择,也是在您可承受的硬件资源范围内的最佳方案。
模型、方法、序列长度和数据集大小都会影响性能。我们不会在此公布具体的倍数,因为准确的倍数取决于这四个因素,而随意编造一个低估你机器性能的数字,对我们双方都比沟通更糟糕。如果答案是多显卡,那么多GPU和多节点架构就能解释这种配置的具体情况。
训练循环会持续不断地通过处理器和显卡之间的链路传输数据批次,因此底层机器的 PCIe 版本是一个实际的限制因素,而非规格参数。对驻留模型进行推理几乎不会受到 PCIe 版本的影响。哪个平台对应哪个显卡,哪个链路的信息会发布在GPU 专用服务器上,并在多 GPU 和多节点环境下进行跨平台比较。
接下来该去哪里?
本页面仅包含一个问题:运行模型需要哪些条件。所有相关内容都有各自的页面,本页面即为所有相关页面。
之前问过
这些问题取材于用户在聊天和工单中实际提出的问题,大致按提问顺序排列。前两个问题决定了购买是否成功。
For the record
Card memory is the manufacturers’ published figure; which cards exist is read from the order catalogue when this page was served. No monthly price appears here on purpose — GPU dedicated servers holds every one, against the exact machine it belongs to.