Servidores cloud
Servidores GPU e Computação AI
A Kapsule GPU server is a single-tenant physical machine fitted with NVIDIA graphics processors and the CPU, memory and fast storage needed to keep them fed, built for AI training, inference and…
Um servidor Kapsule GPU é uma máquina física de um único usuário equipada com processadores gráficos NVIDIA e a CPU, memória e armazenamento rápido necessários para alimentá-los, desenvolvido para treinamento de IA, inferência e outro trabalho altamente paralelo.
Você obtém toda a máquina. O trabalho de ninguém mais está compartilhando sua GPU, sua largura de banda de memória ou seu disco, que é a diferença entre um benchmark que você pode reproduzir e um que não consegue. Este guia abrange os quatro níveis, para o que servem, como funciona a encomenda considerando que a oferta de GPU é realmente limitada, e para o que é a taxa de configuração.
Os Quatro Níveis
| Nível | GPU | Memória GPU | Memória do sistema | Mensal | Configuração única |
|---|---|---|---|---|---|
| Spark | NVIDIA RTX 4000 | 20 GB | Incluída na compilação | US$330.00 | Sim |
| Forge | NVIDIA RTX PRO 6000 | 96 GB | 256 GB | US$1,680.00 | Sim |
| Foundry | NVIDIA RTX PRO 6000 | 96 GB | 512 GB | US$2,520.00 | Sim |
| Reactor | NVIDIA RTX PRO 6000 | 96 GB | 768 GB | US$3,240.00 | Sim |
Os preços são mostrados excluindo GST em sua moeda de faturamento. Cada nível vem sem gerenciamento ou gerenciado, a mesma opção que nossos servidores em nuvem.
O salto de Spark para Forge é o significativo. Spark é um ponto de entrada para desenvolvimento, modelos menores e trabalho de inferência. Forge, Foundry e Reactor compartilham os mesmos 96 GB de memória GPU e diferem na memória do sistema, que é o que governa quanto você pode manter na RAM do host ao lado do modelo: preparação de dados, pipelines de pré-processamento e atendimento a muitas solicitações simultâneas.
O que Você Pode Executar
Você obtém controle total da máquina, então executa sua própria pilha. Isso inclui PyTorch, TensorFlow, JAX, cargas de trabalho CUDA brutos e os frameworks de treinamento e atendimento usuais.
Usos típicos:
- Treinamento e ajuste fino de modelos para aprendizado de máquina e aprendizado profundo.
- Inferência e atendimento em produção, onde uma GPU transforma um tempo de resposta inaceitável em um aceitável.
- Cargas de trabalho de IA em lote: embeddings, transcrição, geração de imagem e vídeo, renderização.
- Computação científica e paralela que se beneficia da aceleração GPU.
Dimensione primeiro na memória GPU. O erro mais comum é escolher um nível por preço e depois descobrir que o modelo não cabe em VRAM. Calcule a memória que seu modelo precisa em sua precisão pretendida e tamanho de lote, adicione espaço e escolha o nível que satisfaz. A memória do sistema e a CPU são muito mais fáceis de contornar do que um modelo que não será carregado.
Disponibilidade e Como Funciona a Encomenda
Hardware GPU está em alta demanda em toda a indústria e o fornecimento é limitado. Este é um fato sobre o mercado, não uma política Kapsule, e molda como estas são encomendadas.
- Estas são máquinas físicas, então são provisionadas sob encomenda e não em segundos.
- A disponibilidade varia por nível e localização, e é verificada em tempo real quando você consulta a página de planos.
- Spark está atualmente com restrição de fornecimento. Quando não há estoque, o painel oferece a fila de reserva em vez de uma ordem inválida.
Para configurações maiores ou personalizadas, confirmamos o build exato e o preço exato com você antes do provisionamento, para que você sempre saiba o que está recebendo. Não fornecemos uma configuração que não conseguimos entregar.
A Fila de Reserva
Quando um nível de GPU está fora de estoque, você pode reservá-lo em vez de desistir:
- Reserve o nível na página de planos. Você recebe uma referência de reserva.
- Nada é cobrado. Uma reserva é gratuita e nenhuma assinatura começa.
- Quando a capacidade fica disponível, provisionamos a máquina para você automaticamente.
- Seu primeiro pagamento é feito apenas quando o servidor está ativo, e sua data de faturamento começa a partir daquele dia.
- Cancele a qualquer momento enquanto aguarda, sem custo.
Regiões, Disponibilidade e a Fila de Reserva explica a mecânica completa.
Não coloque uma reserva de GPU em um prazo fixo. A capacidade retorna quando retorna, e preferimos dizer isso claramente a prometer uma data que não conseguimos manter. Se você tiver uma data de entrega fixa, fale conosco antes de fazer o pedido.
Encomendar Uma
- Inicie a sessão em KPanel.
- Abra Store na barra lateral esquerda e escolha GPU, ou acesse diretamente
/plans/compute?group=gpu. - Use o botão Unmanaged e Managed para escolher o formulário que deseja.
- Cada nível mostra sua GPU, sua VRAM, sua memória do sistema, seu preço mensal e sua taxa de configuração única, além de um badge de estoque ativo.

A Taxa de Configuração
Um servidor Kapsule GPU tem uma taxa de configuração única no checkout além do preço mensal recorrente, porque uma máquina física precisa ser construída e provisionada para você.
- Cobrado uma vez, no provisionamento. Ele nunca aparece em uma renovação.
- Mostrado como sua própria linha no checkout, rotulado como Setup (one-time), com seu próprio recibo.
- Sujeito a GST quando a moeda de sua conta é NZD.
Consulte Preços de Servidores em Nuvem e GST para saber como encargos únicos e recorrentes aparecem em suas faturas.
Como Servidores GPU Diferem de Servidores em Nuvem
| Servidores em Nuvem | Servidores GPU | |
|---|---|---|
| Hardware | Máquinas virtuais | Máquinas físicas de um único usuário com GPUs NVIDIA |
| Provisionamento | Imediato, sujeito a estoque | Sob encomenda, às vezes pela fila de reserva |
| Taxa de configuração | Nenhuma | Uma vez |
| Redimensionamento ao vivo no KPanel | Sim | Não |
| Dimensionado em | vCPU, memória, disco | Memória GPU primeiro, depois memória do sistema |
Servidores GPU não podem ser redimensionados no local. Mover entre níveis significa encomendar a nova máquina e migrar seu trabalho para ela. Escolha o nível que se adequa aos modelos que você espera executar, não apenas aquele que está executando esta semana.
Antes de Encomendar
Tenha estas respostas prontas, porque determinam o nível:
- Treinamento ou inferência? O treinamento geralmente consome muita memória e é de longa duração. A inferência geralmente é sensível à latência e simultânea.
- Qual modelo, em qual precisão? Isto define o piso de memória GPU.
- Quantos dados, e onde eles vivem? Preparar um grande conjunto de dados é para o que a memória do sistema e o disco servem.
- Qual framework? Para que possamos confirmar expectativas de driver e CUDA antecipadamente.
Nos diga essas quatro coisas e indicaremos o nível correto, ou montaremos uma configuração se nenhum dos quatro padrões se encaixar. Pergunte a Kora dentro do KPanel, ou envie um e-mail para support@kapsulehost.com, e nossa equipe da Nova Zelândia o ajudará.
Solução de Problemas
O nível que quero mostra Fora de estoque. Reserve-o. Você não paga nada enquanto aguarda e provisionamos automaticamente quando a capacidade retorna.
Meu modelo não cabe em VRAM. Passe para um nível superior, ou reduza a precisão ou tamanho de lote. Forge, Foundry e Reactor, todos carregam 96 GB de memória GPU.
Preciso de mais de uma GPU, ou de uma configuração que você não lista. Entre em contato conosco com seus requisitos e confirmaremos o que podemos construir e quanto custa antes de qualquer cobrança.
Posso experimentar antes de me comprometer? Fale conosco sobre começar no Spark para trabalho de desenvolvimento e passar para um nível superior quando seu pipeline for comprovado.