Servidores en la nube
Servidores de GPU y computación con IA
A Kapsule GPU server is a single-tenant physical machine fitted with NVIDIA graphics processors and the CPU, memory and fast storage needed to keep them fed, built for AI training, inference and…
Un servidor Kapsule GPU es una máquina física de un solo usuario equipada con procesadores gráficos NVIDIA y la CPU, memoria y almacenamiento rápido necesarios para alimentarlos, diseñado para entrenamiento de IA, inferencia y otro trabajo altamente paralelo.
Obtienes la máquina completa. El trabajo de nadie más comparte tu GPU, tu ancho de banda de memoria ni tu disco, que es la diferencia entre un benchmark que puedes reproducir y uno que no. Esta guía cubre los cuatro niveles, para qué sirven, cómo funciona el pedido dado que la disponibilidad de GPU es realmente limitada, y para qué se cobran las tarifas de configuración.
Los Cuatro Niveles
| Nivel | GPU | Memoria GPU | Memoria del sistema | Mensual | Configuración única |
|---|---|---|---|---|---|
| Spark | NVIDIA RTX 4000 | 20 GB | Incluida en la compilación | US$330.00 | Sí |
| Forge | NVIDIA RTX PRO 6000 | 96 GB | 256 GB | US$1,680.00 | Sí |
| Foundry | NVIDIA RTX PRO 6000 | 96 GB | 512 GB | US$2,520.00 | Sí |
| Reactor | NVIDIA RTX PRO 6000 | 96 GB | 768 GB | US$3,240.00 | Sí |
Los precios se muestran sin GST en tu moneda de facturación. Cada nivel viene sin gestión o administrado, la misma opción que nuestros servidores en la nube.
El salto de Spark a Forge es el más significativo. Spark es un punto de entrada para desarrollo, modelos más pequeños y trabajo de inferencia. Forge, Foundry y Reactor comparten los mismos 96 GB de memoria GPU y difieren en memoria del sistema, que es lo que determina cuánto puedes mantener en RAM del host junto al modelo: staging de conjuntos de datos, pipelines de preprocesamiento y atender muchas solicitudes concurrentes.
Qué Puedes Ejecutar
Tienes control total de la máquina, así que ejecutas tu propio stack. Eso incluye PyTorch, TensorFlow, JAX, cargas de trabajo CUDA sin procesar, y los frameworks habituales de entrenamiento y serving sobre ellos.
Usos típicos:
- Entrenamiento de modelos y ajuste fino para aprendizaje automático y aprendizaje profundo.
- Inferencia y serving en producción, donde una GPU convierte un tiempo de respuesta inaceptable en uno aceptable.
- Cargas de trabajo de IA por lotes: embeddings, transcripción, generación de imágenes y vídeo, renderizado.
- Computación científica y paralela que se beneficia de la aceleración GPU.
Considera primero el tamaño en memoria GPU. El error más común es elegir un nivel por precio y luego descubrir que el modelo no cabe en VRAM. Calcula la memoria que tu modelo necesita con tu precisión e tamaño de lote previstos, añade margen, y elige el nivel que lo permita. La memoria del sistema y la CPU son mucho más fáciles de trabajar que un modelo que no cargará.
Disponibilidad y Cómo Funciona la Ordenación
El hardware GPU está en alta demanda en toda la industria y la disponibilidad es limitada. Es un hecho sobre el mercado, no una política de Kapsule, y esto determina cómo se ordenan estos.
- Estas son máquinas físicas, así que se aprovisionan por encargo en lugar de en segundos.
- La disponibilidad varía según el nivel y la ubicación, y se verifica en vivo cuando consultas la página de planes.
- Spark está actualmente limitado en disponibilidad. Cuando no hay stock, el panel te ofrece la cola de reserva en lugar de un pedido fallido.
Para configuraciones más grandes o personalizadas confirmamos la compilación exacta y el precio exacto contigo antes de aprovisionar, así siempre sabes qué obtendrás. No cotizamos una configuración que no podamos entregar.
La Cola de Reserva
Cuando un nivel de GPU está agotado, puedes reservarlo en lugar de irte:
- Reserva el nivel desde la página de planes. Obtienes una referencia de reserva.
- No se cobra nada. Una reserva es gratuita y ninguna suscripción comienza.
- Cuando aparezca capacidad, aprovisionamos la máquina para ti automáticamente.
- Tu primer pago se toma solo una vez que el servidor esté activo, y tu fecha de facturación comienza desde ese día.
- Cancela en cualquier momento mientras esperas, sin costo alguno.
Regiones, Disponibilidad y la Cola de Reserva explica la mecánica en su totalidad.
No pongas una reserva de GPU con una fecha límite fija. La capacidad vuelve cuando vuelve, y preferimos decirte eso claramente que prometer una fecha que no podemos mantener. Si tienes una fecha de entrega fija, habla con nosotros antes de ordenar.
Pedirle Uno
- Inicia sesión en KPanel.
- Abre Store en la barra lateral izquierda y elige GPU, o ve directamente a
/plans/compute?group=gpu. - Usa el conmutador Unmanaged y Managed para elegir el formulario que quieras.
- Cada nivel muestra su GPU, su VRAM, su memoria del sistema, su precio mensual y su tarifa de configuración única, más una insignia de stock en vivo.

La Tarifa de Configuración
Un servidor GPU tiene una tarifa de configuración única en el checkout además del precio mensual recurrente, porque una máquina física tiene que ser compilada y aprovisionada para ti.
- Cobrada una vez, en el aprovisionamiento. Nunca aparece en una renovación.
- Se muestra como su propia línea en el checkout, etiquetada como Setup (one-time), con su propio recibo.
- Sujeta a GST cuando la moneda de tu cuenta es NZD.
Ve Cloud Server Pricing and GST para ver cómo aparecen los cargos únicos y recurrentes en tus facturas.
Cómo los Servidores GPU Difieren de los Servidores en la Nube
| Servidores en la Nube | Servidores GPU | |
|---|---|---|
| Hardware | Máquinas virtuales | Máquinas físicas de un solo usuario con GPUs NVIDIA |
| Aprovisionamiento | Inmediato, sujeto a disponibilidad | Por encargo, a veces a través de la cola de reserva |
| Tarifa de configuración | Ninguna | Única |
| Cambio de tamaño en vivo en KPanel | Sí | No |
| Dimensionado en | vCPU, memoria, disco | Memoria GPU primero, luego memoria del sistema |
Los servidores GPU no se pueden cambiar de tamaño en su lugar. Cambiar entre niveles significa ordenar la nueva máquina y migrar tu trabajo a ella. Elige el nivel que se ajuste a los modelos que esperas ejecutar, no solo el que estés ejecutando esta semana.
Antes de Ordenar
Ten estas respuestas listas, porque determinan el nivel:
- ¿Entrenamiento o inferencia?** El entrenamiento generalmente requiere mucha memoria y es de larga duración. La inferencia generalmente es sensible a la latencia y concurrente.
- ¿Qué modelo, con qué precisión? Esto establece el límite inferior de memoria GPU.
- ¿Cuántos datos, y dónde viven? El staging de un conjunto de datos grande es para lo que sirven la memoria del sistema y el disco.
- ¿Qué framework? Para que podamos confirmar las expectativas de controlador y CUDA por adelantado.
Cuéntanos esas cuatro cosas y te señalaremos el nivel correcto, o armaremos una configuración si ninguno de los cuatro estándar se ajusta. Pregunta a Kora dentro de KPanel, o envía un correo a support@kapsulehost.com, y nuestro equipo de Nueva Zelanda te ayudará.
Solución de Problemas
El nivel que quiero muestra Agotado. Resérvalo. No pagas nada mientras esperas y aprovisionamos automáticamente cuando vuelve la capacidad.
Mi modelo no cabe en VRAM. Sube a un nivel superior, o reduce la precisión o el tamaño del lote. Forge, Foundry y Reactor todos llevan 96 GB de memoria GPU.
Necesito más de una GPU, o una configuración que no listes. Ponte en contacto con nosotros con tus requisitos y confirmaremos qué podemos compilar y qué cuesta antes de que se cobre nada.
¿Puedo probar antes de comprometerme? Habla con nosotros sobre comenzar con Spark para trabajo de desarrollo y subir una vez que tu pipeline esté probado.