Un chatbot solo tuyo
Ejecuta un modelo abierto como Llama, Qwen o Mistral en un servidor que nadie más usa. Las instrucciones, los documentos y las respuestas se quedan en tu máquina en lugar de ir a la API de otro.
NVIDIA CMP 170HX · desbloqueada cuando la instalamos
NVIDIA construyó la CMP 170HX para minería y bloqueó todo lo demás: la tarjeta mostraba 8 GB de memoria y ejecutaba cálculos de coma flotante a paso de tortuga. El bloqueo resultó ser por software. Instalamos un controlador que lo elimina, de modo que su servidor llega con una tarjeta que tiene 64 GB de memoria muy rápida y ejecuta modelos de IA tal como su chip fue diseñado para hacerlo.
Misma tarjeta, mismo chip. La parte gris es lo que NVIDIA dejó activado; el resto es lo que el controlador enciende.
Para qué sirve ahora
Ejecuta un modelo abierto como Llama, Qwen o Mistral en un servidor que nadie más usa. Las instrucciones, los documentos y las respuestas se quedan en tu máquina en lugar de ir a la API de otro.
Un modelo de 70 mil millones de parámetros cabe en una tarjeta desbloqueada a 4 bits. En una tarjeta que no ha sido desbloqueada, el límite es un modelo de unos 8 mil millones.
Lo que el modelo no usa va a su contexto, así que los documentos largos y los chats extensos siguen adelante en lugar de quedarse sin espacio a mitad de camino.
Un modelo de chat, un modelo de embeddings para búsqueda y un modelo pequeño que enruta las solicitudes pueden permanecer cargados juntos, en lugar de turnarse.
Un precio mensual fijo y sin medidor, ni en la tarjeta ni en el ancho de banda. Deja un lote ejecutándose durante el fin de semana y la factura no se mueve.
Solo pesos, con entre un cuarto y la mitad de nuevo reservado para la conversación en sí. La guía completa de dimensionamiento está en nuestra página de LLM.
La misma tarjeta, antes y después
LTT Labs desbloqueó una CMP 170HX en septiembre de 2026 y ejecutó los mismos modelos en ella de ambas formas. Estos son sus resultados, no los nuestros. Las velocidades cambian según el modelo y el software, así que tómalos como la magnitud del salto y no como una cifra que debamos cumplir.
Estas cifras proceden del artículo de LTT Labs de septiembre de 2026, que ejecutó llama.cpp en su propio equipo de pruebas. El desbloqueo en sí es cmpunlocker, un proyecto de código abierto de Amogh Munikote.
Qué ocurre después de hacer el pedido
Elige Ubuntu 22.04, 24.04 o 26.04 en el configurador. El desbloqueo es un controlador de Linux, así que esta es la única elección que importa.
Se coloca la tarjeta, se instala Ubuntu y el controlador desbloqueado se integra para el kernel exacto que ejecutará tu servidor.
El servidor se apaga por completo y se vuelve a encender, que es lo que necesita el desbloqueo, y se comprueba la memoria completa de cada tarjeta antes de entregar el servidor.
Cuando Ubuntu instala un kernel nuevo, el controlador se recompila solo para adaptarse. Escribe cmp-unlock status cuando quieras ver cómo está funcionando cada tarjeta.
Conviene saberlo antes de comprar
Cuánto cuesta
La tarjeta tiene su propia línea en la factura y el servidor otra, para que veas cuánto cuesta cada uno. La cifra mostrada corresponde a una tarjeta en el servidor más pequeño que la admite. Añade memoria, discos más grandes o más tarjetas en el configurador y verás el nuevo total al momento.
Hay una cuota única de configuración porque la tarjeta se instala según tu pedido. El ancho de banda es ilimitado, el impuesto de ventas de EE. UU. se añade al finalizar la compra cuando corresponde, y el precio mensual es el mismo al renovar.
$272.67/month
Intel Xeon Silver 4110 8 Core 2.10 GHz · 16 GB DDR4 · 2 × SATA-SSD 240 GB (RAID 1) · 1 Gbps
Preguntas
NVIDIA vendió la CMP 170HX como tarjeta de minería y desactivó la mayor parte por software: mostraba 8 GB de memoria y hacía cálculos de coma flotante muy lentamente. Un controlador comunitario llamado cmpunlocker vuelve a activar esas partes. Una tarjeta desbloqueada tiene 64 GB de memoria y funciona a la velocidad del chip que lleva dentro, que es el mismo chip que una A100.
64 GB en la versión de 8 GB de la tarjeta, que es lo que verá en nvidia-smi. La versión de 10 GB se desbloquea a 40 GB, porque más que eso no es fiable en ella. Sin el controlador desbloqueado, ambas muestran la memoria con la que se enviaron.
No. Pida el servidor con Ubuntu 22.04, 24.04 o 26.04 y llega desbloqueado. Instalamos el controlador, compilamos el desbloqueo para su kernel y comprobamos cada tarjeta antes de entregarle el servidor.
Sí. El controlador desbloqueado se carga cada vez que el servidor arranca, y cuando Ubuntu instala un kernel nuevo el desbloqueo se recompila solo para él. Si alguna tarjeta muestra 8 GB, apague y encienda el servidor desde el panel de control, y avísenos si eso no lo soluciona.
Cualquier cosa hecha para tarjetas NVIDIA: PyTorch, llama.cpp, Ollama, vLLM y el resto. Instale el kit de herramientas CUDA con apt install cuda-toolkit. Evite los paquetes llamados cuda y cuda-drivers, que añadirían un segundo controlador; configuramos el servidor para rechazarlos.
Puede, pero el desbloqueo solo existe para Linux, así que en Windows la tarjeta se queda en 8 GB con sus límites originales. Para cualquier cosa que necesite la memoria, elija Ubuntu.
Hasta cuatro. Dos tarjetas desbloqueadas suman 128 GB entre ambas, suficiente para un modelo de 70 mil millones de parámetros a 8 bits.
Sí, el desbloqueo no quita nada. Aunque si la minería es el plan principal, nuestra página de minería cubre las tarjetas y los costes para ello.
La tarjeta se instala según su pedido, lo que convierte el servidor en una configuración personalizada, y las configuraciones personalizadas conllevan una tarifa única de configuración. Se cobra una sola vez, y el precio mensual no sube al renovar.