Serverless inference
200+ open modellen per token afrekenen via een OpenAI-compatibele API.
AI-cloud voor open-source modellen: serverless inference, fine-tuning en GPU-clusters onder één dak
Together AI biedt hosted inference voor meer dan 200 open-source modellen — van Llama, DeepSeek en Qwen tot FLUX (beeld), Kling (video) en Whisper (spraak). Het platform is uitgegroeid van inference-API naar volwaardige AI-cloud: naast serverless per-token inference verhuur je dedicated endpoints en complete GPU-clusters met H100-, H200-, B200- en GB200-hardware in 25+ datacenters. Fine-tuning (SFT en DPO) zit ingebouwd, inclusief hosting van het resultaat. De API is OpenAI-compatibel en ondersteunt streaming, function calling en JSON-mode. Voor teams die open modellen serieus in productie draaien is Together een van de meest complete platformen.
Feiten geverifieerd op 6 juni 2026 · hoe wij beoordelen
Together AI is de go-to keuze voor teams die open-source modellen in productie willen draaien met fine-tuning opties. Breder aanbod dan Fireworks AI, iets minder gefocust op pure snelheid.
Waarom op de site: Together AI groeide snel als betaalbaar en breed alternatief voor de OpenAI API en werd populair als inference-laag voor open-source model-experimenten en fine-tuning.
Beste alternatief: fireworks-ai
Teams en developers die betaalbare, schaalbare inference nodig hebben voor open-source LLM's, inclusief fine-tuning op eigen datasets, zonder eigen GPU-clusters.
200+ open modellen per token afrekenen via een OpenAI-compatibele API.
SFT en DPO op eigen data, inclusief hosting van het fine-tuned model.
Naast LLM's ook beeldmodellen (FLUX), videomodellen (Kling) en speech (Whisper).
Streaming, function calling en JSON-mode — drop-in migratie vanaf OpenAI.
Eigen GPU-capaciteit per uur voor voorspelbare latency en throughput.
Huur H100- tot GB200-clusters met InfiniBand voor training en grootschalige inference.
Serverless: pay-as-you-go per token, circa $0,03-$4,50 per miljoen tokens afhankelijk van model. Dedicated endpoints per GPU-uur (H100 ~$6,49/uur). GPU-clusters vanaf ~$4/uur per H100 (reserved). Fine-tuning per miljoen trainings-tokens.
Prijzen indicatief — controleer altijd de actuele tarieven bij de aanbieder.
Typ een toolnaam, categorie of use case
Zoeken...
Geen tools gevonden
Wat de wereld er van zegt
In het nieuws
Together AI and Y Combinator partner to launch the first dedicated GPU cluster for the YC community
No more two-year compute contracts. Together AI and YC just gave YC startups a faster way to get GPUs.
Together AI brings Thinking Machines Lab’s new model Inkling on day 0
Together AI positions open-weight AI models as the enterprise moat for cost, control and IP
Enterprises racing to deploy AI at scale are discovering that the biggest constraint isn’t model capability anymore — it’s control. As agentic AI moves from experimentation into core business processe
New in Together GPU Clusters: Reliability and control for production GPU clusters
See how Together AI is improving production GPU clusters with passive health checks, node repair, stronger Slurm reliability, OIDC, and startup scripts.