# Baseten

> Lowest measured time to first token, with OpenAI and Anthropic-compatible endpoints.

Canonical: https://www.subconscious.dev/providers/baseten · By The Subconscious Team · Updated September 30, 2026

- Founded: 2019
- Example models: GLM 5.2, gpt-oss 120B
- Website: https://www.baseten.co

## Overview

Baseten runs two products. Model APIs serve a curated set of 13 open models, including DeepSeek V4, GLM 5.2, Kimi K3 and gpt-oss 120B, over endpoints that speak both the OpenAI Chat Completions shape and the Anthropic Messages shape. That dual compatibility means an existing OpenAI or Claude SDK, or a coding agent, points at Baseten with a base URL change. Dedicated deployments take any model you package with the open-source Truss CLI and bill per GPU minute, with an H100 at about $6.50 an hour.

Baseten posted the lowest time to first token on the Artificial Analysis provider board in August 2026, 0.49 seconds, and its stack does KV cache-aware routing that pays off on agentic coding traffic. It also sells white-label infrastructure to model labs. Poolside launched its Laguna models on a Baseten-run branded API with metering, per-key limits and sampled traffic feeding back into training, live within 48 hours of signup. Founded in 2019, the company has raised over $585M and reportedly sits at a $13B valuation after a 2026 Series F.

## Upsides

- Lowest measured time to first token among the major open-model hosts.
- OpenAI and Anthropic API compatibility on every endpoint.
- Per-minute GPU billing with scale to zero and a 99.99% uptime SLA.
- Self-host, HIPAA and data residency options for regulated buyers.

## Core use cases

- Serving private fine-tunes or custom non-LLM models like speech and embeddings.
- Model labs that want a white-label production API without building one.

## Downsides

- A 13-model catalog means anything off-list pushes you into running your own deployment.
- Effective H100 pricing runs well above DeepInfra and Together clusters.

## At a glance

| Attribute | Value |
|---|---|
| Model access | Open weights, 13 curated |
| Flagship models | GLM 5.2, DeepSeek V4, Kimi K3, gpt-oss 120B |
| Speed | 0.49s TTFT, lowest measured |
| Price | H100 about $6.50/hr dedicated |
| Customization | Deploy any model with Truss |
| Deployment | Model APIs, dedicated, self-host |
| Long context | Varies by model |

## FAQ

### What is Baseten?

Baseten runs two products. Model APIs serve a curated set of 13 open models, including DeepSeek V4, GLM 5.2, Kimi K3 and gpt-oss 120B, over endpoints that speak both the OpenAI Chat Completions shape and the Anthropic Messages shape. That dual compatibility means an existing OpenAI or Claude SDK, or a coding agent, points at Baseten with a base URL change. Dedicated deployments take any model you package with the open-source Truss CLI and bill per GPU minute, with an H100 at about $6.50 an hour.

### What is Baseten best for?

Serving private fine-tunes or custom non-LLM models like speech and embeddings; Model labs that want a white-label production API without building one.

### How much does Baseten cost?

Baseten pricing at a glance: H100 about $6.50/hr dedicated. Rates change often, so check Baseten's pricing page before committing.

### How much context does Baseten support?

Baseten's long-context support: Varies by model.

### What are the downsides of Baseten?

A 13-model catalog means anything off-list pushes you into running your own deployment; Effective H100 pricing runs well above DeepInfra and Together clusters.

### What are the best alternatives to Baseten?

Common alternatives include Subconscious, OpenAI, Anthropic, Google Vertex AI, Amazon Bedrock. Each has a head-to-head comparison with Baseten on this site.

## Comparisons

- [Subconscious vs Baseten](https://www.subconscious.dev/compare/subconscious-vs-baseten.md)
- [OpenAI vs Baseten](https://www.subconscious.dev/compare/openai-vs-baseten.md)
- [Anthropic vs Baseten](https://www.subconscious.dev/compare/anthropic-vs-baseten.md)
- [Google Vertex AI vs Baseten](https://www.subconscious.dev/compare/google-vertex-vs-baseten.md)
- [Amazon Bedrock vs Baseten](https://www.subconscious.dev/compare/aws-bedrock-vs-baseten.md)
- [Together AI vs Baseten](https://www.subconscious.dev/compare/together-ai-vs-baseten.md)
- [Fireworks AI vs Baseten](https://www.subconscious.dev/compare/fireworks-vs-baseten.md)
- [Baseten vs Groq](https://www.subconscious.dev/compare/baseten-vs-groq.md)
- [Baseten vs Cerebras](https://www.subconscious.dev/compare/baseten-vs-cerebras.md)
- [Baseten vs DeepInfra](https://www.subconscious.dev/compare/baseten-vs-deepinfra.md)
- [Baseten vs Modal](https://www.subconscious.dev/compare/baseten-vs-modal.md)
- [Baseten vs xAI](https://www.subconscious.dev/compare/baseten-vs-xai.md)
- [Baseten vs DeepSeek](https://www.subconscious.dev/compare/baseten-vs-deepseek.md)
- [Baseten vs Moonshot AI](https://www.subconscious.dev/compare/baseten-vs-moonshot-ai.md)
- [Baseten vs Z.ai](https://www.subconscious.dev/compare/baseten-vs-z-ai.md)
- [Baseten vs Alibaba Cloud](https://www.subconscious.dev/compare/baseten-vs-alibaba-cloud.md)
- [Baseten vs Meta](https://www.subconscious.dev/compare/baseten-vs-meta.md)
- [Baseten vs SambaNova](https://www.subconscious.dev/compare/baseten-vs-sambanova.md)
- [Baseten vs Nebius](https://www.subconscious.dev/compare/baseten-vs-nebius.md)
- [Baseten vs fal](https://www.subconscious.dev/compare/baseten-vs-fal.md)
- [Baseten vs Novita AI](https://www.subconscious.dev/compare/baseten-vs-novita-ai.md)
- [Baseten vs Parasail](https://www.subconscious.dev/compare/baseten-vs-parasail.md)
- [Baseten vs Inference.net](https://www.subconscious.dev/compare/baseten-vs-inference-net.md)
- [Baseten vs GMI Cloud](https://www.subconscious.dev/compare/baseten-vs-gmi-cloud.md)
- [Baseten vs Sail Research](https://www.subconscious.dev/compare/baseten-vs-sail-research.md)
- [Baseten vs Morph](https://www.subconscious.dev/compare/baseten-vs-morph.md)
- [Baseten vs Relace](https://www.subconscious.dev/compare/baseten-vs-relace.md)
- [Baseten vs TypeSafe AI](https://www.subconscious.dev/compare/baseten-vs-typesafe-ai.md)
- [Baseten vs StepFun](https://www.subconscious.dev/compare/baseten-vs-stepfun.md)
- [Baseten vs Runware](https://www.subconscious.dev/compare/baseten-vs-runware.md)
- [Baseten vs StreamLake](https://www.subconscious.dev/compare/baseten-vs-streamlake.md)
- [Baseten vs Wafer](https://www.subconscious.dev/compare/baseten-vs-wafer.md)
- [Baseten vs RunInfra](https://www.subconscious.dev/compare/baseten-vs-runinfra.md)
- [Baseten vs Particle.AI](https://www.subconscious.dev/compare/baseten-vs-particle-ai.md)

## Sources

- [Baseten review, Continuum](https://continuumcode.ai/guides/baseten-review/)
- [Poolside case study](https://www.baseten.co/resources/customers/how-baseten-powered-poolsides-model-launch-in-record-time/)

Pricing and model lineups change often; figures are a snapshot.
