WebLLM is an open-source engine that runs large language model inference directly in web browsers using WebGPU. It supports OpenAI-compatible chat APIs, streaming, JSON mode, workers, service workers, Chrome extensions, browser caching, and custom MLC-format models. Built-in model families include Llama, Phi, Gemma, Mistral, and Qwen.

