Server cloud
Server GPU e AI Compute
A Kapsule GPU server is a single-tenant physical machine fitted with NVIDIA graphics processors and the CPU, memory and fast storage needed to keep them fed, built for AI training, inference and…
Un server Kapsule GPU è una macchina fisica single-tenant equipaggiata con processori grafici NVIDIA e la CPU, la memoria e lo storage veloce necessari per alimentarli, costruita per il training AI, l'inferenza e altri lavori massicciamente paralleli.
Ottieni l'intera macchina. Nessun altro lavoro sta condividendo la tua GPU, la tua larghezza di banda di memoria o il tuo disco, il che è la differenza tra un benchmark che puoi riprodurre e uno che non puoi. Questa guida copre i quattro tier, a cosa sono adatti, come funziona l'ordine dato che l'offerta di GPU è veramente limitata, e a cosa serve la tassa di configurazione.
I Quattro Tier
| Tier | GPU | Memoria GPU | Memoria di sistema | Mensile | Setup unico |
|---|---|---|---|---|---|
| Spark | NVIDIA RTX 4000 | 20 GB | Inclusa nella build | US$330.00 | Sì |
| Forge | NVIDIA RTX PRO 6000 | 96 GB | 256 GB | US$1,680.00 | Sì |
| Foundry | NVIDIA RTX PRO 6000 | 96 GB | 512 GB | US$2,520.00 | Sì |
| Reactor | NVIDIA RTX PRO 6000 | 96 GB | 768 GB | US$3,240.00 | Sì |
I prezzi sono mostrati escludendo l'IVA nella tua valuta di fatturazione. Ogni tier è disponibile non gestito o gestito, la stessa scelta dei nostri server cloud.
Il salto da Spark a Forge è quello significativo. Spark è un punto di ingresso per lo sviluppo, modelli più piccoli e lavori di inferenza. Forge, Foundry e Reactor condividono gli stessi 96 GB di memoria GPU e differiscono nella memoria di sistema, che è quella che governa quanta memoria host puoi avere insieme al modello: staging dei dataset, pipeline di preprocessing e servizio di molte richieste concurrent.
Cosa Puoi Eseguire
Hai il controllo completo della macchina, quindi esegui il tuo stack. Questo include PyTorch, TensorFlow, JAX, workload CUDA puri, e i soliti framework di training e serving sopra di essi.
Usi tipici:
- Training e fine-tuning dei modelli per machine learning e deep learning.
- Inferenza e serving in produzione, dove una GPU trasforma un tempo di risposta inaccettabile in uno accettabile.
- Workload AI batch: embeddings, trascrizione, generazione di immagini e video, rendering.
- Calcolo scientifico e parallelo che beneficia dall'accelerazione GPU.
Dimensiona prima sulla memoria GPU. L'errore più comune è scegliere un tier in base al prezzo e poi scoprire che il modello non entra in VRAM. Calcola la memoria di cui il tuo modello ha bisogno alla tua precisione intesa e alla dimensione del batch, aggiungi margine, e scegli il tier che la copre. La memoria di sistema e la CPU sono molto più facili da aggirare rispetto a un modello che non si caricherà.
Disponibilità e Come Funziona l'Ordine
L'hardware GPU è molto richiesto in tutta l'industria e l'offerta è limitata. È un fatto del mercato, non una politica Kapsule, e forma il modo in cui questi vengono ordinati.
- Queste sono macchine fisiche, quindi sono provisionate su ordine piuttosto che in secondi.
- La disponibilità varia per tier e per localizzazione, ed è controllata in tempo reale quando guardi la pagina dei piani.
- Spark è attualmente vincolato dall'offerta. Quando non ha stock, il pannello ti offre la coda di prenotazione piuttosto che un ordine rotto.
Per configurazioni più grandi o personalizzate confirmiamo la build esatta e il prezzo esatto con te prima del provisioning, quindi sai sempre cosa stai ottenendo. Non quotizziamo una configurazione che non possiamo consegnare.
La Coda di Prenotazione
Quando un tier GPU è esaurito, puoi prenotarlo invece di andartene:
- Prenota il tier dalla pagina dei piani. Ricevi un riferimento di prenotazione.
- Nulla viene addebitato. Una prenotazione è gratuita e nessun abbonamento inizia.
- Quando la capacità appare, provisioniamo la macchina per te automaticamente.
- Il tuo primo pagamento viene richiesto solo una volta che il server è live, e la tua data di fatturazione inizia da quel giorno.
- Cancella in qualsiasi momento mentre aspetti, senza costi.
Regioni, Disponibilità e la Coda di Prenotazione spiega i dettagli completi.
Non mettere una prenotazione GPU su una scadenza fissa. La capacità ritorna quando ritorna, e preferiamo dirti questo chiaramente piuttosto che promettere una data che non possiamo mantenere. Se hai una data di consegna fissa, parlaci prima di ordinare.
Ordinarne Una
- Accedi a KPanel.
- Apri Store nella barra laterale sinistra e scegli GPU, o vai direttamente a
/plans/compute?group=gpu. - Usa il toggle Unmanaged e Managed per scegliere il modulo che vuoi.
- Ogni tier mostra la sua GPU, il suo VRAM, la sua memoria di sistema, il suo prezzo mensile e la sua tassa di setup unica, più un badge di stock live.

La Tassa di Setup
Un server GPU comporta una tassa di setup unica al checkout in aggiunta al prezzo mensile ricorrente, perché una macchina fisica deve essere costruita e provisionate per te.
- Addebitata una volta, al provisioning. Non appare mai su un rinnovo.
- Mostrata come sua propria riga al checkout, etichettata Setup (one-time), con sua propria ricevuta.
- Soggetta all'IVA quando la tua valuta di conto è NZD.
Vedi Prezzi dei Server Cloud e IVA per come le spese una tantum e ricorrenti appaiono sulle tue fatture.
Come i Server GPU Differiscono dai Server Cloud
| Server Cloud | Server GPU | |
|---|---|---|
| Hardware | Macchine virtuali | Macchine fisiche single-tenant con GPU NVIDIA |
| Provisioning | Immediato, soggetto a stock | Su ordine, a volte via coda di prenotazione |
| Tassa di setup | Nessuna | Una tantum |
| Ridimensionamento live in KPanel | Sì | No |
| Dimensionato su | vCPU, memoria, disco | Memoria GPU prima, poi memoria di sistema |
I server GPU non possono essere ridimensionati in posizione. Spostarsi tra i tier significa ordinare la nuova macchina e migrare il tuo lavoro su di essa. Scegli il tier che si adatta ai modelli che ti aspetti di eseguire, non solo quello che stai eseguendo questa settimana.
Prima di Ordinare
Avere pronte queste risposte, perché determinano il tier:
- Training o inferenza? Il training di solito è affamato di memoria e a lunga durata. L'inferenza è di solito sensibile alla latenza e concurrent.
- Quale modello, a quale precisione? Questo imposta il floor di memoria GPU.
- Quanti dati, e dove vivono? Lo staging di un dataset grande è quello per cui la memoria di sistema e il disco servono.
- Quale framework? Così possiamo confermare le aspettative di driver e CUDA in anticipo.
Dicci queste quattro cose e ti indicheremo il tier giusto, o assembleremo una configurazione se nessuno dei quattro standard si adatta. Chiedi a Kora dentro KPanel, o invia un'email a support@kapsulehost.com, e il nostro team della Nuova Zelanda ti aiuterà.
Troubleshooting
Il tier che voglio mostra Esaurito. Prenotalo. Non paghi nulla mentre aspetti e provisioniamo automaticamente quando la capacità ritorna.
Il mio modello non entra in VRAM. Spostati su un tier più alto, o riduci la precisione o la dimensione del batch. Forge, Foundry e Reactor portano tutti 96 GB di memoria GPU.
Ho bisogno di più di una GPU, o di una configurazione che non elencate. Contattaci con i tuoi requisiti e confirmeremo cosa possiamo costruire e cosa costa prima che qualcosa sia addebitato.
Posso provare prima di impegnarmi? Parlaci di iniziare su Spark per il lavoro di sviluppo e salire una volta che la tua pipeline è provata.