Um chatbot só seu
Rode um modelo aberto como Llama, Qwen ou Mistral em um servidor que ninguém mais usa. Prompts, documentos e respostas ficam na sua máquina, em vez de irem para a API de terceiros.
NVIDIA CMP 170HX · desbloqueada quando a instalamos
A NVIDIA construiu a CMP 170HX para mineração e trancou todo o resto: a placa mostrava 8 GB de memória e executava cálculos de ponto flutuante a passo de tartaruga. O bloqueio acabou por ser apenas software. Instalamos um driver que o remove, para que o seu servidor chegue com uma placa com 64 GB de memória muito rápida e execute modelos de IA da forma para a qual o chip foi projetado.
Mesma placa, mesmo chip. A parte cinzenta é o que a NVIDIA deixou ativo; o resto é o que o driver liga.
No que ela é boa agora
Rode um modelo aberto como Llama, Qwen ou Mistral em um servidor que ninguém mais usa. Prompts, documentos e respostas ficam na sua máquina, em vez de irem para a API de terceiros.
Um modelo de 70 bilhões de parâmetros cabe em uma placa desbloqueada a 4 bits. Em uma placa que não foi desbloqueada, o teto é um modelo de cerca de 8 bilhões.
O que o modelo não usa vai para o contexto, então documentos longos e conversas extensas continuam fluindo, em vez de ficarem sem espaço no meio do caminho.
Um modelo de chat, um modelo de embeddings para busca e um modelo pequeno que roteia requisições podem ficar todos carregados juntos, em vez de se revezarem.
Um preço mensal fixo e sem medidor, na placa ou na largura de banda. Deixe um lote rodando no fim de semana e a conta não muda.
Somente pesos, com um quarto a metade a mais mantido livre para a própria conversa. O guia completo de dimensionamento está na nossa página de LLM.
A mesma placa, antes e depois
A LTT Labs desbloqueou uma CMP 170HX em setembro de 2026 e rodou os mesmos modelos nela das duas formas. Estes são os resultados deles, não os nossos. As velocidades variam conforme o modelo e o software, então encare-os como o tamanho do salto, e não como um número que devamos cumprir.
Esses números vêm do artigo da LTT Labs de setembro de 2026, que rodou o llama.cpp na própria máquina de testes deles. O desbloqueio em si é o cmpunlocker, um projeto de código aberto de Amogh Munikote.
O que acontece depois do pedido
Escolha Ubuntu 22.04, 24.04 ou 26.04 no configurador. O desbloqueio é um driver Linux, então esta é a única escolha que importa.
A placa é instalada, o Ubuntu é carregado e o driver desbloqueado é integrado para o kernel exato que seu servidor executará.
O servidor é totalmente desligado e religado, que é o que o desbloqueio exige, e cada placa é verificada quanto à memória total antes de o servidor ser entregue.
Quando o Ubuntu instala um novo kernel, o driver se reconstrói para corresponder. Digite cmp-unlock status sempre que quiser ver como cada placa está funcionando.
Vale a pena saber antes de comprar
Quanto custa
A placa tem a própria linha na fatura e o servidor tem outra, para você ver quanto cada um custa. O valor mostrado é de uma placa no menor servidor que a aceita. Adicione memória, discos maiores ou mais placas no configurador e ele mostra o novo total na hora.
Há uma taxa única de instalação porque a placa é montada de acordo com o seu pedido. A largura de banda é ilimitada, o imposto sobre vendas dos EUA é adicionado no checkout quando aplicável, e o preço mensal é o mesmo na renovação.
$272.67/month
Intel Xeon Silver 4110 8 Core 2.10 GHz · 16 GB DDR4 · 2 × SATA-SSD 240 GB (RAID 1) · 1 Gbps
Perguntas
A NVIDIA vendeu a CMP 170HX como placa de mineração e desligou a maior parte dela por software: mostrava 8 GB de memória e fazia cálculos de ponto flutuante muito devagar. Um driver da comunidade chamado cmpunlocker volta a ligar essas partes. Uma placa desbloqueada tem 64 GB de memória e corre à velocidade do chip que tem lá dentro, que é o mesmo chip de uma A100.
64 GB na versão de 8 GB da placa, que é o que verá no nvidia-smi. A versão de 10 GB desbloqueia para 40 GB, porque acima disso não é fiável nela. Sem o driver desbloqueado, ambas mostram a memória com que foram vendidas.
Não. Encomende o servidor com Ubuntu 22.04, 24.04 ou 26.04 e ele chega desbloqueado. Instalamos o driver, compilamos o desbloqueio para o seu kernel e verificamos cada placa antes de entregar o servidor.
Sim. O driver desbloqueado carrega sempre que o servidor arranca e, quando o Ubuntu instala um kernel novo, o desbloqueio recompila-se para ele. Se alguma placa mostrar 8 GB, desligue e volte a ligar o servidor no painel de controlo e diga-nos se isso não resolver.
Qualquer coisa feita para placas NVIDIA: PyTorch, llama.cpp, Ollama, vLLM e o resto. Instale o kit de ferramentas CUDA com apt install cuda-toolkit. Evite os pacotes chamados cuda e cuda-drivers, que adicionariam um segundo driver; configuramos o servidor para os recusar.
Pode, mas o desbloqueio só existe para Linux, por isso no Windows a placa fica nos 8 GB com os limites originais. Para qualquer coisa que precise da memória, escolha Ubuntu.
Até quatro. Duas placas desbloqueadas somam 128 GB entre elas, o suficiente para um modelo de 70 mil milhões de parâmetros a 8 bits.
Sim, o desbloqueio não tira nada. No entanto, se a mineração for o plano principal, a nossa página de mineração cobre as placas e os custos para isso.
A placa é montada à medida da sua encomenda, o que torna o servidor uma construção personalizada, e construções personalizadas têm uma taxa única de instalação. É cobrada uma vez e o preço mensal não sobe quando renova.