Ryzen AI 独立服务器 • 无需显卡的推理

小型模型在 Ryzen AI 机器上运行良好。这正是重点所在。

并非每个工作负载都配得上一块显卡。一个适度大小的量化模型从系统内存中应答,独占整台机器 — 你的运行时、你的版本、裸金属上的 root 权限 — 而无需为那些任务根本用不上的硅片付费。

把你的 GPU 变成每月的被动收入。

有闲置的服务器或台式机 GPU 配置?今天就上架到 Primcast 市场,从需要生产级算力的 AI 团队、开发者和企业那里赚取稳定的月租。

前往市场

哪些情况下跳过显卡才是正确选择

每次都是同样的模式:模型很小,流量适中,数据必须留在一台不属于任何其他人的机器上。

内部文档上的私人助理
私有数据上的私人助手

一个小型量化模型为少数同事阅读你自己的文档。语料库从不接触共享端点,每月成本是一台机器,而不是一个计量表。

批量草稿撰写与摘要生成
草稿、摘要、批量运行

夜间摘要、打标签、重写 — 可以排队的工作。这里重要的是每项任务的成本,而不是每个 token 的毫秒数,而这正是显卡最被浪费的工作负载。

调用模型的内部工具
安静调用模型的工具

工单路由、日志分诊、抽取到数据库:一个位于内部端点之后的小型模型,全天运行,按财务表能看懂的固定费率计费。

评估 NPU 工具链
试试 NPU 的成色

在真实硅片上按月租用,运行 AMD 的 XDNA 工具链,然后再签下整个机群的订单。哪些部分无法移植,会最先在这里暴露出来,而且成本很低。

这笔交易,直说无妨

这些机器对合适的工作负载来说是实打实的价值,对不合适的工作负载则是错误的采购。下面是两者的分界线。

内存是宽敞的部分

模型驻留在机器自身的内存中,以数十 GB 计,而不是显卡的配额。在这页上,装不装得下很少成为问题。

带宽是狭窄的部分

每个生成的 token 都要重新读取权重,而系统内存的读取速度比显卡内存慢。一个小模型上只有一个用户时无所谓;用户排起队来就有所谓了。我们不发布任何速度数据 — 这里没有,任何地方都没有 — 而是如实说明这一点。

下单前常被问到的问题

四个坦诚的回答 — 与我们的工程师在聊天中给出的完全一致。

服务器真的能在没有显卡的情况下运行语言模型吗?

可以,但有些限制值得一开始就说清楚:一个小型量化模型以读取速度从系统内存生成内容,适合单个用户、内部工具或批处理队列 — 但不适合一大群人。某个模型需要多少内存,以及为什么一个装得下的模型仍然可能无法提供服务,我们的 LLM 页面有完整的推演。

NPU 能运行我的模型吗?

可以,通过 AMD 自家的 Ryzen AI 工具链 — 但人们实际部署的大多数开源模型运行时使用的是处理器和集成 Radeon,我们宁愿在这里如实说明,也不愿让规格表暗示别的意思。无论如何 NPU 都在芯片上,没有什么能阻止你针对它进行开发。

什么时候改用独立 GPU 更值得?

当模型大到超出内存、当多人需要同时得到答案,或者当你在做微调而不是提供服务时。Ryzen AI 还是独立 GPU会带你走完这个决策,而GPU 页面为每一块显卡标明了对应机器的价格。

其中任何部分会与其他客户共享吗?

不会。你租下的是整台机器:处理器、显卡、NPU、内存、磁盘和端口在任一时刻只属于一个客户,底层没有虚拟机监控程序。月费的大部分买的就是这一点。