The rate at which an AI model generates output tokens, typically measured in tokens per second, serving as a critical performance metric for user experience and latency-sensitive applications.

Overview

  • Google’s Gemini 3.7 Flash model ran at 340 tokens per second during testing by Artificial Analysis, making it more than twice as fast as GPT-5.6 Luna. (Source: AI Daily Brief host citing Artificial Analysis testing, via AI Daily Brief, 2026-08-24)
  • [Emerging signal] The ‘model race’ is branching out into multiple distinct competitions, including races for frontier capability, distribution, harnesses, revenue, and speed, with Google specifically betting that speed is a dimension users will pay attention to. (Source: AI Daily Brief host, via AI Daily Brief, 2026-08-24)

Provenance