Cloud-Server
GPU- und KI-Compute-Server
A Kapsule GPU server is a single-tenant physical machine fitted with NVIDIA graphics processors and the CPU, memory and fast storage needed to keep them fed, built for AI training, inference and…
Ein Kapsule GPU Server ist eine Single-Tenant-Maschine mit NVIDIA-Grafikprozessoren sowie der CPU, dem Speicher und der schnellen Festplatte, die notwendig sind, um diese zu versorgen. Er ist für KI-Training, Inferenz und andere stark parallele Aufgaben ausgelegt.
Sie erhalten die ganze Maschine. Niemand sonst teilt sich Ihre GPU, Ihre Speicherbandbreite oder Ihre Festplatte, was den Unterschied zwischen einem Benchmark ausmacht, den Sie reproduzieren können, und einem, den Sie nicht können. Dieser Leitfaden behandelt die vier Leistungsstufen, wofür sie geeignet sind, wie die Bestellung funktioniert angesichts der angespannten GPU-Verfügbarkeit, und wofür die Einrichtungsgebühr anfällt.
Die vier Leistungsstufen
| Stufe | GPU | GPU-Speicher | Systemspeicher | Monatlich | Einmalige Einrichtung |
|---|---|---|---|---|---|
| Spark | NVIDIA RTX 4000 | 20 GB | In der Konfiguration enthalten | US$330.00 | Ja |
| Forge | NVIDIA RTX PRO 6000 | 96 GB | 256 GB | US$1,680.00 | Ja |
| Foundry | NVIDIA RTX PRO 6000 | 96 GB | 512 GB | US$2,520.00 | Ja |
| Reactor | NVIDIA RTX PRO 6000 | 96 GB | 768 GB | US$3,240.00 | Ja |
Die Preise werden ohne GST in Ihrer Abrechnungswährung angezeigt. Jede Stufe ist als unverwaltete oder verwaltete Variante erhältlich, wie auch bei unseren Cloud Servern.
Der Sprung von Spark zu Forge ist der bedeutsamste. Spark ist ein Einstiegspunkt für Entwicklung, kleinere Modelle und Inferenzaufgaben. Forge, Foundry und Reactor teilen sich den gleichen 96 GB GPU-Speicher und unterscheiden sich im Systemspeicher, der bestimmt, wie viel Sie im Host-RAM neben dem Modell halten können: Datenstaging, Vorverarbeitungs-Pipelines und die Bedienung vieler gleichzeitiger Anfragen.
Was Sie ausführen können
Sie haben vollständige Kontrolle über die Maschine und können Ihren eigenen Stack ausführen. Dazu gehören PyTorch, TensorFlow, JAX, native CUDA-Workloads und die üblichen Training- und Serving-Frameworks auf Basis dieser.
Typische Anwendungsfälle:
- Modelltraining und Fine-Tuning für Machine Learning und Deep Learning.
- Inferenz und Serving in der Produktion, wobei eine GPU eine inakzeptable Antwortzeit in eine akzeptable umwandelt.
- Batch-KI-Workloads: Embeddings, Transkription, Bild- und Videogenerierung, Rendering.
- Wissenschaftliche und parallele Berechnung, die von GPU-Beschleunigung profitiert.
Wählen Sie zuerst basierend auf dem GPU-Speicher. Der häufigste Fehler ist, eine Stufe nach Preis zu wählen und dann zu entdecken, dass das Modell nicht in den VRAM passt. Berechnen Sie den Speicher, den Ihr Modell bei Ihrer beabsichtigten Genauigkeit und Batch-Größe benötigt, fügen Sie Puffer hinzu und wählen Sie die Stufe, die dies erfüllt. Systemspeicher und CPU sind viel leichter zu umgehen als ein Modell, das sich nicht laden lässt.
Verfügbarkeit und wie die Bestellung funktioniert
GPU-Hardware ist in der gesamten Industrie in hoher Nachfrage und das Angebot ist begrenzt. Das ist eine Tatsache des Marktes, keine KapsuleHost-Richtlinie, und sie bestimmt, wie diese bestellt werden.
- Dies sind physische Maschinen, daher werden sie auf Bestellung bereitgestellt und nicht in Sekunden.
- Die Verfügbarkeit variiert je nach Stufe und Standort und wird live überprüft, wenn Sie die Seite Pläne aufrufen.
- Spark ist derzeit versorgungsengpässe. Wenn es keinen Bestand hat, bietet das Panel Ihnen stattdessen die Reservierungswarteschlange an.
Für größere oder benutzerdefinierte Konfigurationen bestätigen wir den genauen Build und den genauen Preis mit Ihnen, bevor die Bereitstellung erfolgt, damit Sie immer wissen, was Sie bekommen. Wir bieten keine Konfiguration an, die wir nicht liefern können.
Die Reservierungswarteschlange
Wenn eine GPU-Stufe nicht verfügbar ist, können Sie sie stattdessen reservieren:
- Reservieren Sie die Stufe auf der Seite Pläne. Sie erhalten eine Reservierungsreferenz.
- Nichts wird berechnet. Eine Reservierung ist kostenlos und kein Abonnement beginnt.
- Wenn Kapazität verfügbar wird, stellen wir die Maschine automatisch für Sie bereit.
- Ihre erste Zahlung wird erst erhoben, wenn der Server online ist, und Ihr Abrechnungsdatum beginnt ab diesem Tag.
- Sie können jederzeit widerrufen, während Sie warten, ohne Kosten.
Regionen, Verfügbarkeit und die Reservierungswarteschlange erklärt die Funktionsweise vollständig.
Setzen Sie eine GPU-Reservierung nicht auf einen festgelegten Termin. Kapazität wird verfügbar, wann sie verfügbar wird, und wir möchten lieber ehrlich zu Ihnen sein, als ein Datum zu versprechen, das wir nicht halten können. Wenn Sie einen festen Lieferdatum haben, sprechen Sie mit uns, bevor Sie bestellen.
So bestellen Sie einen
- Melden Sie sich bei KPanel an.
- Öffnen Sie Store in der linken Seitenleiste und wählen Sie GPU, oder gehen Sie direkt zu
/plans/compute?group=gpu. - Verwenden Sie den Umschalter Unverwaltete und Verwaltete, um die gewünschte Form zu wählen.
- Jede Stufe zeigt ihre GPU, ihren VRAM, ihren Systemspeicher, ihren monatlichen Preis und ihre einmalige Einrichtungsgebühr sowie ein Live-Verfügbarkeitsbadge.

Die Einrichtungsgebühr
Ein GPU Server wird mit einer einmaligen Einrichtungsgebühr beim Auschecken zusätzlich zum wiederkehrenden monatlichen Preis belastet, da eine physische Maschine für Sie gebaut und bereitgestellt werden muss.
- Wird einmalig bei der Bereitstellung berechnet. Sie erscheint niemals bei einer Verlängerung.
- Wird beim Auschecken als eigene Zeile angezeigt, mit der Bezeichnung Einrichtung (einmalig), mit eigener Quittung.
- Unterliegt der GST, wenn Ihre Kontowährung NZD ist.
Unter Cloud Server Preisgestaltung und GST erfahren Sie, wie einmalige und wiederkehrende Gebühren auf Ihren Rechnungen angezeigt werden.
Wie sich GPU Server von Cloud Servern unterscheiden
| Cloud Server | GPU Server | |
|---|---|---|
| Hardware | Virtuelle Maschinen | Single-Tenant-Physische Maschinen mit NVIDIA GPUs |
| Bereitstellung | Sofort, je nach Verfügbarkeit | Auf Bestellung, manchmal über die Reservierungswarteschlange |
| Einrichtungsgebühr | Keine | Einmalig |
| Live-Größenänderung in KPanel | Ja | Nein |
| Größe basierend auf | vCPU, Speicher, Festplatte | GPU-Speicher zuerst, dann Systemspeicher |
GPU Server können nicht vor Ort vergrößert werden. Der Wechsel zwischen Stufen bedeutet, die neue Maschine zu bestellen und Ihre Arbeit zu migrieren. Wählen Sie die Stufe, die den Modellen entspricht, die Sie voraussichtlich ausführen werden, nicht nur der, die Sie diese Woche ausführen.
Bevor Sie bestellen
Haben Sie diese Antworten bereit, da sie die Stufe bestimmen:
- Training oder Inferenz? Training ist normalerweise speicherintensiv und langwierig. Inferenz ist normalerweise latenzempfindlich und gleichzeitig.
- Welches Modell, bei welcher Genauigkeit? Dies bestimmt die GPU-Speichermindestanforderung.
- Wie viele Daten und wo befinden sie sich? Das Staging eines großen Datensatzes ist wofür Systemspeicher und Festplatte gedacht sind.
- Welches Framework? Damit wir die Treiber- und CUDA-Anforderungen vorher bestätigen können.
Teilen Sie uns diese vier Dinge mit und wir zeigen Ihnen die richtige Stufe oder stellen eine Konfiguration zusammen, wenn keine der Standardkonfigurationen passt. Fragen Sie Kora in KPanel oder senden Sie eine E-Mail an support@kapsulehost.com, und unser Team in Neuseeland wird Ihnen helfen.
Fehlerbehebung
Die Stufe, die ich möchte, zeigt Nicht verfügbar an. Reservieren Sie sie. Sie zahlen nichts, während Sie warten, und wir stellen automatisch bereit, wenn die Kapazität zurückkehrt.
Mein Modell passt nicht in den VRAM. Wechseln Sie zu einer höheren Stufe oder reduzieren Sie die Genauigkeit oder Batch-Größe. Forge, Foundry und Reactor bieten alle 96 GB GPU-Speicher.
Ich benötige mehr als eine GPU oder eine Konfiguration, die Sie nicht anbieten. Kontaktieren Sie uns mit Ihren Anforderungen und wir bestätigen Ihnen, was wir bauen können und was es kostet, bevor etwas berechnet wird.
Kann ich es vorher testen? Sprechen Sie mit uns darüber, mit Spark für Entwicklungsarbeit zu beginnen und später aufzusteigen, wenn Ihre Pipeline bewährt ist.