Synthszr Charts — die großen AI-Marken im Wettkampf ums Podium
synthszr charts
vllm

Vllm · seit Juni 2023 (offizieller Launch-Blogpost); zugehöriges Paper September 2023 · 59× · zuletzt 13. Aug. 2026

100
Momentum

vLLM ist eine quelloffene Inference- und Serving-Engine für Large Language Models, ursprünglich am Sky Computing Lab der UC Berkeley entwickelt. Kern der Software ist PagedAttention, ein Speicherverwaltungsverfahren für den KV-Cache, kombiniert mit kontinuierlichem Batching, das hohen Durchsatz und geringen Speicherverbrauch beim Modell-Serving ermöglicht. Das Projekt unterstützt über 200 Modellarchitekturen von HuggingFace, zahlreiche Quantisierungsformate sowie diverse Hardware-Backends (NVIDIA, AMD, Intel, TPU, Trainium). vLLM wird als kostenloses Open-Source-Projekt unter Apache-2.0-Lizenz vertrieben und lässt sich selbst hosten oder über einen OpenAI-kompatiblen HTTP-Server betreiben.

Momentum-Verlauf
20.05.18.08.

Features

Deployment (Self-host/Cloud)Self-hosted via pip/uv-Installation oder Docker-Image (vllm/vllm-openai); K8s-natives Deployment über production-stack
Durchsatz/LatenzBis zu 24x höherer Durchsatz als HuggingFace Transformers (offizieller Launch-Benchmark 2023)
LizenzApache License 2.0
PlattformPython-Bibliothek/Server; unterstützt NVIDIA-, AMD-GPUs, Intel-CPUs, TPU, AWS Trainium/Inferentia, Apple Silicon (via vLLM-Metal); Python 3.10–3.13
PreisKostenlos, Open Source (keine Lizenzgebühren; Kosten entstehen nur durch selbst betriebene Infrastruktur)
Protokoll-KompatibilitätOpenAI-kompatibler HTTP-Server (Chat Completions, Responses API, SageMaker-kompatibler Endpunkt)
Release-DatumJuni 2023 (Launch-Blogpost 'Easy, Fast, and Cheap LLM Serving with PagedAttention')
Unterstützte Modelle/Provider200+ Modellarchitekturen auf HuggingFace (u.a. Llama, DeepSeek, Qwen); Quantisierung: FP8, MXFP8/MXFP4, NVFP4, INT8, INT4, GPTQ/AWQ, GGUF

Weitere Produkte in dieser Kategorie: LLM-Inferenz & Serving

Belege (59)

Subscribe free. Unsubscribe the second it sucks.

High-signal news across AI, business, UX, and tech. Every morning.