每次都是同样的模式:模型很小,流量适中,数据必须留在一台不属于任何其他人的机器上。
一个小型量化模型为少数同事阅读你自己的文档。语料库从不接触共享端点,每月成本是一台机器,而不是一个计量表。
夜间摘要、打标签、重写 — 可以排队的工作。这里重要的是每项任务的成本,而不是每个 token 的毫秒数,而这正是显卡最被浪费的工作负载。
工单路由、日志分诊、抽取到数据库:一个位于内部端点之后的小型模型,全天运行,按财务表能看懂的固定费率计费。
在真实硅片上按月租用,运行 AMD 的 XDNA 工具链,然后再签下整个机群的订单。哪些部分无法移植,会最先在这里暴露出来,而且成本很低。
这些机器对合适的工作负载来说是实打实的价值,对不合适的工作负载则是错误的采购。下面是两者的分界线。
模型驻留在机器自身的内存中,以数十 GB 计,而不是显卡的配额。在这页上,装不装得下很少成为问题。
每个生成的 token 都要重新读取权重,而系统内存的读取速度比显卡内存慢。一个小模型上只有一个用户时无所谓;用户排起队来就有所谓了。我们不发布任何速度数据 — 这里没有,任何地方都没有 — 而是如实说明这一点。
超出这个范围也不会前功尽弃:你的模型需要多少内存在 LLM 页面上有完整推演,我们安装的每一块显卡都标明了价格,DGX Spark 则是同一理念的顶级版本,配备 GPU 可寻址的 128 GB 内存。
四个坦诚的回答 — 与我们的工程师在聊天中给出的完全一致。
可以,但有些限制值得一开始就说清楚:一个小型量化模型以读取速度从系统内存生成内容,适合单个用户、内部工具或批处理队列 — 但不适合一大群人。某个模型需要多少内存,以及为什么一个装得下的模型仍然可能无法提供服务,我们的 LLM 页面有完整的推演。
可以,通过 AMD 自家的 Ryzen AI 工具链 — 但人们实际部署的大多数开源模型运行时使用的是处理器和集成 Radeon,我们宁愿在这里如实说明,也不愿让规格表暗示别的意思。无论如何 NPU 都在芯片上,没有什么能阻止你针对它进行开发。
当模型大到超出内存、当多人需要同时得到答案,或者当你在做微调而不是提供服务时。Ryzen AI 还是独立 GPU会带你走完这个决策,而GPU 页面为每一块显卡标明了对应机器的价格。
不会。你租下的是整台机器:处理器、显卡、NPU、内存、磁盘和端口在任一时刻只属于一个客户,底层没有虚拟机监控程序。月费的大部分买的就是这一点。