# Cloudflare Workers AI

> Serverless open-model inference on Cloudflare GPUs, called straight from Workers and billed in Neurons.

Canonical: https://www.subconscious.dev/providers/cloudflare-workers-ai · By The Subconscious Team · Updated September 30, 2026

- Founded: 2009
- Example models: DeepSeek V4 Pro, GLM 5.3
- Website: https://developers.cloudflare.com/workers-ai/

## Overview

Workers AI is the serverless GPU inference service of Cloudflare, which was founded in 2009. It launched in September 2023 and reached general availability in April 2024. Models run on GPUs inside Cloudflare's own network and are called from a Worker through an AI binding or over REST, including OpenAI-compatible Chat Completions and Embeddings endpoints plus a Responses endpoint for gpt-oss. The catalog lists 50+ open models. Since Kimi K2.5 arrived in March 2026 it has carried frontier-scale LLMs: Kimi K2.6 and K2.7 Code, GLM 5.2 and 5.3, DeepSeek V4 Pro and Flash, gpt-oss 120B and 20B, Qwen 3.8 27B and Llama 4 Scout. DeepSeek V4, added August 14, 2026, was the first to offer the full 1,048,576 token context.

Billing is in Neurons at $0.011 per 1,000, with 10,000 Neurons a day free, and Cloudflare publishes per-token equivalents for each model. DeepSeek V4 Pro costs $1.32 in and $3.96 out per million, GLM 5.3 $1.40 and $4.40, Kimi K2.6 $0.95 and $4.00, and gpt-oss 120B $0.35 and $0.75. Prefix caching bills cached input at a discount, and an x-session-affinity header pins a conversation to one instance to raise hit rates. LoRA adapters are bring-your-own, in free open beta, capped at rank 32, 300MB and 100 per account, and limited to smaller non-quantized models. AI Gateway adds caching, rate limits, retries, fallbacks and logs, and since August 2026 shares billing with Workers AI.

## Upsides

- Inference, code, storage and the Agents SDK live on one platform, so an agent can run end to end on Cloudflare.
- Daily free allocation and per-token prices that undercut many GPU hosts on gpt-oss and Llama models.
- OpenAI-compatible endpoints make it a base URL swap for existing SDK code.
- AI Gateway in front of Workers AI and third-party providers gives one place for caching, fallbacks and spend tracking.

## Core use cases

- Agents and chat features built on Workers that need an LLM without a separate vendor.
- Low-cost classification, embeddings and summarization inside existing Cloudflare apps.
- Long-context agent loops on DeepSeek V4 or GLM 5.3 with prefix caching.

## Downsides

- LoRA covers only smaller, older models, and there is no fine-tuning or dedicated deployment for the large LLMs.
- Large models like Kimi K2.6, K2.7 Code and GLM 5.2 require the Workers Paid plan, and synchronous requests can queue for capacity.

## At a glance

| Attribute | Value |
|---|---|
| Model access | Open weights |
| Flagship models | DeepSeek V4 Pro, GLM 5.3, Kimi K2.7 Code, gpt-oss 120B |
| Speed | - |
| Price | $0.011 per 1K Neurons; 10K free daily |
| Customization | BYO LoRA on small models (beta) |
| Deployment | Serverless on Cloudflare network |
| Long context | 1M on DeepSeek V4; 262K on Kimi |

## FAQ

### What is Cloudflare Workers AI?

Workers AI is the serverless GPU inference service of Cloudflare, which was founded in 2009. It launched in September 2023 and reached general availability in April 2024. Models run on GPUs inside Cloudflare's own network and are called from a Worker through an AI binding or over REST, including OpenAI-compatible Chat Completions and Embeddings endpoints plus a Responses endpoint for gpt-oss. The catalog lists 50+ open models. Since Kimi K2.5 arrived in March 2026 it has carried frontier-scale LLMs: Kimi K2.6 and K2.7 Code, GLM 5.2 and 5.3, DeepSeek V4 Pro and Flash, gpt-oss 120B and 20B, Qwen 3.8 27B and Llama 4 Scout. DeepSeek V4, added August 14, 2026, was the first to offer the full 1,048,576 token context.

### What is Cloudflare Workers AI best for?

Agents and chat features built on Workers that need an LLM without a separate vendor; Low-cost classification, embeddings and summarization inside existing Cloudflare apps; Long-context agent loops on DeepSeek V4 or GLM 5.3 with prefix caching.

### How much does Cloudflare Workers AI cost?

Cloudflare Workers AI pricing at a glance: $0.011 per 1K Neurons; 10K free daily. Rates change often, so check Cloudflare Workers AI's pricing page before committing.

### How much context does Cloudflare Workers AI support?

Cloudflare Workers AI's long-context support: 1M on DeepSeek V4; 262K on Kimi.

### What are the downsides of Cloudflare Workers AI?

LoRA covers only smaller, older models, and there is no fine-tuning or dedicated deployment for the large LLMs; Large models like Kimi K2.6, K2.7 Code and GLM 5.2 require the Workers Paid plan, and synchronous requests can queue for capacity.

### What are the best alternatives to Cloudflare Workers AI?

Common alternatives include Subconscious, OpenAI, Anthropic, Google Vertex AI, Amazon Bedrock. Each has a head-to-head comparison with Cloudflare Workers AI on this site.

## Comparisons

- [Subconscious vs Cloudflare Workers AI](https://www.subconscious.dev/compare/subconscious-vs-cloudflare-workers-ai.md)
- [OpenAI vs Cloudflare Workers AI](https://www.subconscious.dev/compare/openai-vs-cloudflare-workers-ai.md)
- [Anthropic vs Cloudflare Workers AI](https://www.subconscious.dev/compare/anthropic-vs-cloudflare-workers-ai.md)
- [Google Vertex AI vs Cloudflare Workers AI](https://www.subconscious.dev/compare/google-vertex-vs-cloudflare-workers-ai.md)
- [Amazon Bedrock vs Cloudflare Workers AI](https://www.subconscious.dev/compare/aws-bedrock-vs-cloudflare-workers-ai.md)
- [Together AI vs Cloudflare Workers AI](https://www.subconscious.dev/compare/together-ai-vs-cloudflare-workers-ai.md)
- [Fireworks AI vs Cloudflare Workers AI](https://www.subconscious.dev/compare/fireworks-vs-cloudflare-workers-ai.md)
- [Baseten vs Cloudflare Workers AI](https://www.subconscious.dev/compare/baseten-vs-cloudflare-workers-ai.md)
- [Groq vs Cloudflare Workers AI](https://www.subconscious.dev/compare/groq-vs-cloudflare-workers-ai.md)
- [Cerebras vs Cloudflare Workers AI](https://www.subconscious.dev/compare/cerebras-vs-cloudflare-workers-ai.md)
- [DeepInfra vs Cloudflare Workers AI](https://www.subconscious.dev/compare/deepinfra-vs-cloudflare-workers-ai.md)
- [Hugging Face Inference Providers vs Cloudflare Workers AI](https://www.subconscious.dev/compare/hugging-face-vs-cloudflare-workers-ai.md)
- [Modal vs Cloudflare Workers AI](https://www.subconscious.dev/compare/modal-vs-cloudflare-workers-ai.md)
- [Cloudflare Workers AI vs xAI](https://www.subconscious.dev/compare/cloudflare-workers-ai-vs-xai.md)
- [Cloudflare Workers AI vs Mistral AI](https://www.subconscious.dev/compare/cloudflare-workers-ai-vs-mistral-ai.md)
- [Cloudflare Workers AI vs DeepSeek](https://www.subconscious.dev/compare/cloudflare-workers-ai-vs-deepseek.md)
- [Cloudflare Workers AI vs Moonshot AI](https://www.subconscious.dev/compare/cloudflare-workers-ai-vs-moonshot-ai.md)
- [Cloudflare Workers AI vs Z.ai](https://www.subconscious.dev/compare/cloudflare-workers-ai-vs-z-ai.md)
- [Cloudflare Workers AI vs Alibaba Cloud](https://www.subconscious.dev/compare/cloudflare-workers-ai-vs-alibaba-cloud.md)
- [Cloudflare Workers AI vs Meta](https://www.subconscious.dev/compare/cloudflare-workers-ai-vs-meta.md)
- [Cloudflare Workers AI vs Cohere](https://www.subconscious.dev/compare/cloudflare-workers-ai-vs-cohere.md)
- [Cloudflare Workers AI vs SambaNova](https://www.subconscious.dev/compare/cloudflare-workers-ai-vs-sambanova.md)
- [Cloudflare Workers AI vs Nebius](https://www.subconscious.dev/compare/cloudflare-workers-ai-vs-nebius.md)
- [Cloudflare Workers AI vs Crusoe](https://www.subconscious.dev/compare/cloudflare-workers-ai-vs-crusoe.md)
- [Cloudflare Workers AI vs fal](https://www.subconscious.dev/compare/cloudflare-workers-ai-vs-fal.md)
- [Cloudflare Workers AI vs Novita AI](https://www.subconscious.dev/compare/cloudflare-workers-ai-vs-novita-ai.md)
- [Cloudflare Workers AI vs Venice](https://www.subconscious.dev/compare/cloudflare-workers-ai-vs-venice.md)
- [Cloudflare Workers AI vs Parasail](https://www.subconscious.dev/compare/cloudflare-workers-ai-vs-parasail.md)
- [Cloudflare Workers AI vs Inference.net](https://www.subconscious.dev/compare/cloudflare-workers-ai-vs-inference-net.md)
- [Cloudflare Workers AI vs GMI Cloud](https://www.subconscious.dev/compare/cloudflare-workers-ai-vs-gmi-cloud.md)
- [Cloudflare Workers AI vs Thinking Machines](https://www.subconscious.dev/compare/cloudflare-workers-ai-vs-thinking-machines.md)
- [Cloudflare Workers AI vs Sail Research](https://www.subconscious.dev/compare/cloudflare-workers-ai-vs-sail-research.md)
- [Cloudflare Workers AI vs Morph](https://www.subconscious.dev/compare/cloudflare-workers-ai-vs-morph.md)
- [Cloudflare Workers AI vs Relace](https://www.subconscious.dev/compare/cloudflare-workers-ai-vs-relace.md)
- [Cloudflare Workers AI vs TypeSafe AI](https://www.subconscious.dev/compare/cloudflare-workers-ai-vs-typesafe-ai.md)
- [Cloudflare Workers AI vs StepFun](https://www.subconscious.dev/compare/cloudflare-workers-ai-vs-stepfun.md)
- [Cloudflare Workers AI vs Runware](https://www.subconscious.dev/compare/cloudflare-workers-ai-vs-runware.md)
- [Cloudflare Workers AI vs StreamLake](https://www.subconscious.dev/compare/cloudflare-workers-ai-vs-streamlake.md)
- [Cloudflare Workers AI vs Wafer](https://www.subconscious.dev/compare/cloudflare-workers-ai-vs-wafer.md)
- [Cloudflare Workers AI vs RunInfra](https://www.subconscious.dev/compare/cloudflare-workers-ai-vs-runinfra.md)
- [Cloudflare Workers AI vs Particle.AI](https://www.subconscious.dev/compare/cloudflare-workers-ai-vs-particle-ai.md)

## Sources

- [Workers AI pricing](https://developers.cloudflare.com/workers-ai/platform/pricing/)
- [Workers AI changelog](https://developers.cloudflare.com/changelog/product/workers-ai/)
- [Workers AI now runs large models](https://blog.cloudflare.com/workers-ai-large-models/)
- [Workers AI LoRA adapters](https://developers.cloudflare.com/workers-ai/features/fine-tunes/loras/)

Pricing and model lineups change often; figures are a snapshot.
