Servidores en la nube

Servidores de GPU y computación con IA

A Kapsule GPU server is a single-tenant physical machine fitted with NVIDIA graphics processors and the CPU, memory and fast storage needed to keep them fed, built for AI training, inference and…

Un servidor Kapsule GPU es una máquina física de un solo usuario equipada con procesadores gráficos NVIDIA y la CPU, memoria y almacenamiento rápido necesarios para alimentarlos, diseñado para entrenamiento de IA, inferencia y otro trabajo altamente paralelo.

Obtienes la máquina completa. El trabajo de nadie más comparte tu GPU, tu ancho de banda de memoria ni tu disco, que es la diferencia entre un benchmark que puedes reproducir y uno que no. Esta guía cubre los cuatro niveles, para qué sirven, cómo funciona el pedido dado que la disponibilidad de GPU es realmente limitada, y para qué se cobran las tarifas de configuración.

Los Cuatro Niveles

NivelGPUMemoria GPUMemoria del sistemaMensualConfiguración única
SparkNVIDIA RTX 400020 GBIncluida en la compilaciónUS$330.00
ForgeNVIDIA RTX PRO 600096 GB256 GBUS$1,680.00
FoundryNVIDIA RTX PRO 600096 GB512 GBUS$2,520.00
ReactorNVIDIA RTX PRO 600096 GB768 GBUS$3,240.00

Los precios se muestran sin GST en tu moneda de facturación. Cada nivel viene sin gestión o administrado, la misma opción que nuestros servidores en la nube.

El salto de Spark a Forge es el más significativo. Spark es un punto de entrada para desarrollo, modelos más pequeños y trabajo de inferencia. Forge, Foundry y Reactor comparten los mismos 96 GB de memoria GPU y difieren en memoria del sistema, que es lo que determina cuánto puedes mantener en RAM del host junto al modelo: staging de conjuntos de datos, pipelines de preprocesamiento y atender muchas solicitudes concurrentes.

Qué Puedes Ejecutar

Tienes control total de la máquina, así que ejecutas tu propio stack. Eso incluye PyTorch, TensorFlow, JAX, cargas de trabajo CUDA sin procesar, y los frameworks habituales de entrenamiento y serving sobre ellos.

Usos típicos:

  • Entrenamiento de modelos y ajuste fino para aprendizaje automático y aprendizaje profundo.
  • Inferencia y serving en producción, donde una GPU convierte un tiempo de respuesta inaceptable en uno aceptable.
  • Cargas de trabajo de IA por lotes: embeddings, transcripción, generación de imágenes y vídeo, renderizado.
  • Computación científica y paralela que se beneficia de la aceleración GPU.

Considera primero el tamaño en memoria GPU. El error más común es elegir un nivel por precio y luego descubrir que el modelo no cabe en VRAM. Calcula la memoria que tu modelo necesita con tu precisión e tamaño de lote previstos, añade margen, y elige el nivel que lo permita. La memoria del sistema y la CPU son mucho más fáciles de trabajar que un modelo que no cargará.

Disponibilidad y Cómo Funciona la Ordenación

El hardware GPU está en alta demanda en toda la industria y la disponibilidad es limitada. Es un hecho sobre el mercado, no una política de Kapsule, y esto determina cómo se ordenan estos.

  • Estas son máquinas físicas, así que se aprovisionan por encargo en lugar de en segundos.
  • La disponibilidad varía según el nivel y la ubicación, y se verifica en vivo cuando consultas la página de planes.
  • Spark está actualmente limitado en disponibilidad. Cuando no hay stock, el panel te ofrece la cola de reserva en lugar de un pedido fallido.

Para configuraciones más grandes o personalizadas confirmamos la compilación exacta y el precio exacto contigo antes de aprovisionar, así siempre sabes qué obtendrás. No cotizamos una configuración que no podamos entregar.

La Cola de Reserva

Cuando un nivel de GPU está agotado, puedes reservarlo en lugar de irte:

  1. Reserva el nivel desde la página de planes. Obtienes una referencia de reserva.
  2. No se cobra nada. Una reserva es gratuita y ninguna suscripción comienza.
  3. Cuando aparezca capacidad, aprovisionamos la máquina para ti automáticamente.
  4. Tu primer pago se toma solo una vez que el servidor esté activo, y tu fecha de facturación comienza desde ese día.
  5. Cancela en cualquier momento mientras esperas, sin costo alguno.

Regiones, Disponibilidad y la Cola de Reserva explica la mecánica en su totalidad.

No pongas una reserva de GPU con una fecha límite fija. La capacidad vuelve cuando vuelve, y preferimos decirte eso claramente que prometer una fecha que no podemos mantener. Si tienes una fecha de entrega fija, habla con nosotros antes de ordenar.

Pedirle Uno

  1. Inicia sesión en KPanel.
  2. Abre Store en la barra lateral izquierda y elige GPU, o ve directamente a /plans/compute?group=gpu.
  3. Usa el conmutador Unmanaged y Managed para elegir el formulario que quieras.
  4. Cada nivel muestra su GPU, su VRAM, su memoria del sistema, su precio mensual y su tarifa de configuración única, más una insignia de stock en vivo.

El grupo GPU en la escalera de planes de computación en KPanel

La Tarifa de Configuración

Un servidor GPU tiene una tarifa de configuración única en el checkout además del precio mensual recurrente, porque una máquina física tiene que ser compilada y aprovisionada para ti.

  • Cobrada una vez, en el aprovisionamiento. Nunca aparece en una renovación.
  • Se muestra como su propia línea en el checkout, etiquetada como Setup (one-time), con su propio recibo.
  • Sujeta a GST cuando la moneda de tu cuenta es NZD.

Ve Cloud Server Pricing and GST para ver cómo aparecen los cargos únicos y recurrentes en tus facturas.

Cómo los Servidores GPU Difieren de los Servidores en la Nube

Servidores en la NubeServidores GPU
HardwareMáquinas virtualesMáquinas físicas de un solo usuario con GPUs NVIDIA
AprovisionamientoInmediato, sujeto a disponibilidadPor encargo, a veces a través de la cola de reserva
Tarifa de configuraciónNingunaÚnica
Cambio de tamaño en vivo en KPanelNo
Dimensionado envCPU, memoria, discoMemoria GPU primero, luego memoria del sistema

Los servidores GPU no se pueden cambiar de tamaño en su lugar. Cambiar entre niveles significa ordenar la nueva máquina y migrar tu trabajo a ella. Elige el nivel que se ajuste a los modelos que esperas ejecutar, no solo el que estés ejecutando esta semana.

Antes de Ordenar

Ten estas respuestas listas, porque determinan el nivel:

  • ¿Entrenamiento o inferencia?** El entrenamiento generalmente requiere mucha memoria y es de larga duración. La inferencia generalmente es sensible a la latencia y concurrente.
  • ¿Qué modelo, con qué precisión? Esto establece el límite inferior de memoria GPU.
  • ¿Cuántos datos, y dónde viven? El staging de un conjunto de datos grande es para lo que sirven la memoria del sistema y el disco.
  • ¿Qué framework? Para que podamos confirmar las expectativas de controlador y CUDA por adelantado.

Cuéntanos esas cuatro cosas y te señalaremos el nivel correcto, o armaremos una configuración si ninguno de los cuatro estándar se ajusta. Pregunta a Kora dentro de KPanel, o envía un correo a support@kapsulehost.com, y nuestro equipo de Nueva Zelanda te ayudará.

Solución de Problemas

El nivel que quiero muestra Agotado. Resérvalo. No pagas nada mientras esperas y aprovisionamos automáticamente cuando vuelve la capacidad.

Mi modelo no cabe en VRAM. Sube a un nivel superior, o reduce la precisión o el tamaño del lote. Forge, Foundry y Reactor todos llevan 96 GB de memoria GPU.

Necesito más de una GPU, o una configuración que no listes. Ponte en contacto con nosotros con tus requisitos y confirmaremos qué podemos compilar y qué cuesta antes de que se cobre nada.

¿Puedo probar antes de comprometerme? Habla con nosotros sobre comenzar con Spark para trabajo de desarrollo y subir una vez que tu pipeline esté probado.

¿Aún necesitas ayuda?

Envíanos un correo electrónico a support@kapsulehost.com o abre un chat en KPanel.

Abrir KPanel
Servidores de GPU y computación con IA