Servidores dedicados Ryzen AI • Inferência sem placa gráfica

Modelos pequenos rodam bem em uma máquina Ryzen AI. Esse é o ponto.

Nem toda carga de trabalho justifica uma placa gráfica. Um modelo quantizado de tamanho modesto responde a partir da memória do sistema em uma máquina inteira só sua — seu runtime, suas versões, root no metal — sem pagar por silício que o trabalho deixaria ocioso.

Transforme suas GPUs em receita mensal passiva.

Tem configurações de GPU de servidor ou desktop paradas? Anuncie-as hoje no marketplace da Primcast e receba aluguéis mensais constantes de equipes de IA, desenvolvedores e empresas que precisam de computação em nível de produção.

Ir para o Marketplace

Onde pular a placa é a decisão certa

O mesmo padrão sempre: o modelo é pequeno, o tráfego é modesto e os dados precisam ficar em uma máquina que não é de mais ninguém.

Assistente privado em documentos internos
Um auxiliar privado em dados privados

Um modelo quantizado pequeno lendo seus próprios documentos para um punhado de colegas. O corpus nunca toca um endpoint compartilhado, e o custo mensal é uma máquina, não um medidor.

Redação e resumo em lote
Rascunhos, resumos, execuções em lote

Resumos noturnos, marcação, reescrita — trabalho que entra em fila. O que importa aí é o custo por tarefa, não os milissegundos por token, e essa é a carga de trabalho em que uma placa gráfica é mais desperdiçada.

Ferramentas internas chamando um modelo
Ferramentas que chamam um modelo silenciosamente

Roteamento de tickets, triagem de logs, extração para um banco de dados: um modelo pequeno atrás de um endpoint interno, ligado o dia todo, a uma taxa fixa que a planilha financeira consegue ler.

Avaliando a cadeia de ferramentas da NPU
Testando os pneus da NPU

Rodar a cadeia de ferramentas XDNA da AMD em silício real, alugado por mês, antes que alguém assine por uma frota dele. O que se recusa a portar aparece aqui primeiro, e barato.

A troca, dita com clareza

Essas máquinas são valor honesto para a carga de trabalho certa e a compra errada para a errada. Aqui está a linha entre as duas.

A memória é a parte espaçosa

O modelo vive na própria memória da máquina, medida em dezenas de gigabytes em vez da cota de uma placa. O que cabe raramente é o problema nesta página.

A largura de banda é a parte estreita

Cada token gerado relê os pesos, e a memória do sistema lê mais devagar que a memória da placa. Um usuário em um modelo pequeno não vai se importar; uma fila de usuários vai. Não publicamos nenhum número de velocidade — aqui nem em lugar nenhum — e dizemos isto em vez disso.

Perguntado antes de encomendar uma

Quatro respostas honestas — as mesmas que nossos engenheiros dão no chat.

Um servidor realmente consegue rodar um modelo de linguagem sem placa gráfica?

Sim, dentro de limites que vale declarar de antemão: um modelo quantizado pequeno gera a partir da memória do sistema em ritmo de leitura, o que atende um usuário, uma ferramenta interna ou uma fila de lote — e não atende uma multidão. Quanta memória um determinado modelo precisa, e por que um que cabe ainda pode falhar ao servir, é exatamente o que nossa página de LLM trabalha.

A NPU roda meu modelo?

Ela pode, por meio da própria cadeia de ferramentas Ryzen AI da AMD — mas a maioria dos runtimes de modelos abertos que as pessoas realmente implantam usa o processador e a Radeon integrada, e preferimos dizer isso aqui a deixar uma ficha técnica dar a entender o contrário. A NPU está no die de qualquer forma, e nada impede você de usá-la como alvo.

Quando vale a pena usar uma GPU dedicada?

Quando o modelo fica maior que a memória, quando várias pessoas precisam de respostas ao mesmo tempo, ou quando você está fazendo ajuste fino em vez de servir. Ryzen AI ou uma GPU dedicada percorre essa decisão, e a página de GPU precifica cada placa em relação à máquina exata em que ela entra.

Alguma parte disso é compartilhada com outros clientes?

Não. Você aluga a máquina inteira: processador, gráficos, NPU, memória, disco e porta pertencem a um cliente por vez, sem hipervisor por baixo. Isso é grande parte do que o valor mensal compra.