开源 LLM 托管
在您控制的硬件上运行 Llama、Mistral、Gemma、Qwen 等模型。
模型
Llama 系列、Mistral、Gemma、微调变体
GPU / AI 计算
面向开源 LLM、计算机视觉、微调和嵌入的 GPU 计算。 实时价格见下方。GPU 库存按订单分配并由人工配置,因此设置并非即时完成。
GPU 计算
实时价格,今日下单
NVIDIA
RTX 级 GPU
4 个层级
从 Spark 到 Reactor
按订单
人工配置
API
配置 + 监控
完整阶梯
有限,缺货时可预订
您将在上面运行什么
这些是 GPU 层级专为其构建的工作负载。如果您的工作负载相符,请选择合适的层级并下单。
在您控制的硬件上运行 Llama、Mistral、Gemma、Qwen 等模型。
模型
Llama 系列、Mistral、Gemma、微调变体
图像分类、目标检测、分割。在同一平台上进行训练和推理,无需重新部署。
模型
YOLO、SAM、自定义 PyTorch / TensorFlow 模型
在开源基础模型上进行 LoRA / QLoRA 微调。按小时计费,只为实际训练时间付费。
模型
LoRA、QLoRA、小型模型全量微调
大规模生成嵌入,用于检索增强生成管道。连接到您的向量数据库。
模型
sentence-transformers、BGE、e5、自定义嵌入模型
Stable Diffusion、FLUX、Kandinsky。批量生成或作为 API 端点提供。
模型
SD、SDXL、FLUX、ControlNet、自定义检查点
语音转文字、文字转语音、声音克隆。Whisper 转录管道。
模型
Whisper、Coqui、Bark、自定义 TTS
立即可用
我们的 Cloud VPS 系列将 JupyterHub 作为一键安装程序提供。CPU 密集型推理、较小模型、嵌入生成、批量管道:无需等待 GPU,今天即可运行。
常见问题
今日即可按所示价格订购任意层级。GPU 库存按订单分配并由人工配置(Robot 级硬件),因此从下单到交付之间会有较短的准备时间,而非即时自助配置。我们会在结账时确认时间。
四个层级的 NVIDIA GPU:Spark 采用 RTX 4000,Forge、Foundry 和 Reactor 采用 RTX PRO 6000,系统内存依次递增。每个层级的 GPU、VRAM 和 RAM 均列于上方的价格表中。
确切的数据中心位置将在交付前与您确认。库存按订单分配并由人工配置,因此我们会在发布时如实说明区域和具体信息。
实时月度价格按层级以您的货币显示在本页面。非托管和托管价格均会显示。
可以。启动一台安装了 JupyterHub 的 Cloud VPS(一键安装)。CPU 密集型 LLM 推理(较小模型)、嵌入生成、批量管道——今天都可以运行。GPU 上线时只需迁移代码,无需重写。
从头训练大型基础模型(我们针对微调和推理,不针对超过 1000 万美元的训练规模)。需要供应商协议的闭源专有模型。发布时需要 InfiniBand 规模多 GPU 集群的任何工作负载(多 GPU 在路线图中,不在正式发布中)。
库存按订单分配并由人工配置,因此从下单到交付之间可能会有较短的准备时间。这与我们的独立服务器和存储服务器产品线采用相同的人工履约流程。
Kora 了解 GPU 计算产品:硬件、定价、支持的框架和部署模式。