# Agent Experience Score

> How well AI coding agents integrate Auth0 — measured across real-world tasks, not synthetic benchmarks.

**Average without Auth0 tools**: 63%
**Average with Auth0 tools**: 97%
**Models tested**: 9 (Claude Haiku 4.5, Claude Opus 4.6, Claude Opus 4.7, Claude Opus 4.8, Claude Sonnet 4.6, GPT-5.4, GPT-5.4 mini, Gemini 3.1 Pro, Gemini 3.5 Flash)
**Frameworks tested**: 13 (Android, Angular, Express, Express API, FastAPI, Fastify API, Flask, Next.js, Nuxt, React, SPA JS, Swift, Vue)
**Total configurations**: 117

[Methodology](https://auth0.com/docs/get-started/auth0-agent-experience)

## Scores

| # | Model | Framework | Without Tools | With Auth0 Tools | Grade | Cost | Time |
|---|-------|-----------|---------------|------------------|-------|------|------|
| 1 | Claude Opus 4.6 | Angular | 100% | 100% | A | $0.38 | 1m 20s |
| 2 | Claude Opus 4.7 | Angular | 100% | 100% | A | $1.06 | 3m 11s |
| 3 | Claude Opus 4.8 | Angular | 100% | 100% | A | $0.58 | 2m 15s |
| 4 | Gemini 3.1 Pro | Angular | 100% | 100% | A | $0.53 | 1m 38s |
| 5 | Gemini 3.5 Flash | Angular | 100% | 100% | A | $0.61 | 1m 42s |
| 6 | Claude Opus 4.6 | Express API | 85% | 100% (+15%) | A | $0.42 | 1m 2s |
| 7 | Claude Opus 4.7 | Express API | 85% | 100% (+15%) | A | $0.29 | 1m 14s |
| 8 | Claude Opus 4.8 | Express API | 83.3% | 100% (+16.7%) | A | $0.33 | 1m 22s |
| 9 | Claude Sonnet 4.6 | Express API | 77% | 100% (+23%) | A | $0.38 | 1m 12s |
| 10 | Gemini 3.1 Pro | Express API | 77% | 100% (+23%) | A | $0.48 | 1m 40s |
| 11 | Claude Opus 4.6 | Express | 87% | 100% (+13%) | A | $0.20 | 40s |
| 12 | Claude Opus 4.7 | Express | 87% | 100% (+13%) | A | $0.39 | 1m 30s |
| 13 | Claude Sonnet 4.6 | Express | 87% | 100% (+13%) | A | $0.28 | 1m 27s |
| 14 | Gemini 3.1 Pro | Express | 80% | 100% (+20%) | A | $0.55 | 1m 31s |
| 15 | Gemini 3.5 Flash | Express | 87% | 100% (+13%) | A | $0.32 | 59s |
| 16 | Claude Opus 4.6 | Fastify API | 50% | 100% (+50%) | A | $0.23 | 45s |
| 17 | Claude Opus 4.7 | Fastify API | 50% | 100% (+50%) | A | $0.32 | 1m 3s |
| 18 | Claude Sonnet 4.6 | Fastify API | 43% | 100% (+57%) | A | $0.14 | 38s |
| 19 | Claude Opus 4.7 | Flask | 43% | 100% (+57%) | A | $0.50 | 1m 46s |
| 20 | Claude Haiku 4.5 | Next.js | 64% | 100% (+36%) | A | $0.23 | 1m 26s |
| 21 | Claude Opus 4.6 | Next.js | 64% | 100% (+36%) | A | $0.44 | 1m 14s |
| 22 | Claude Opus 4.7 | Next.js | 79% | 100% (+21%) | A | $0.71 | 1m 55s |
| 23 | Claude Sonnet 4.6 | Next.js | 79% | 100% (+21%) | A | $0.73 | 3m 2s |
| 24 | Claude Opus 4.6 | Nuxt | 50% | 100% (+50%) | A | $0.33 | 1m 4s |
| 25 | Claude Sonnet 4.6 | Nuxt | 35% | 100% (+65%) | A | $0.40 | 1m 48s |
| 26 | Gemini 3.5 Flash | Nuxt | 30% | 100% (+70%) | A | $0.98 | 2m 0s |
| 27 | Claude Opus 4.6 | React | 100% | 100% | A | $0.30 | 58s |
| 28 | Claude Opus 4.7 | React | 100% | 100% | A | $0.60 | 1m 47s |
| 29 | Claude Opus 4.8 | React | 100% | 100% | A | $0.44 | 1m 34s |
| 30 | Claude Sonnet 4.6 | React | 100% | 100% | A | $0.33 | 1m 31s |
| 31 | Gemini 3.1 Pro | React | 100% | 100% | A | $0.21 | 45s |
| 32 | Gemini 3.5 Flash | React | 100% | 100% | A | $0.70 | 1m 53s |
| 33 | Claude Opus 4.6 | SPA JS | 100% | 100% | A | $0.25 | 52s |
| 34 | Claude Opus 4.8 | SPA JS | 100% | 100% | A | $0.27 | 1m 6s |
| 35 | Claude Sonnet 4.6 | SPA JS | 100% | 100% | A | $0.18 | 1m 2s |
| 36 | Gemini 3.1 Pro | SPA JS | 93% | 100% (+7%) | A | $0.43 | 1m 5s |
| 37 | Gemini 3.5 Flash | SPA JS | 93% | 100% (+7%) | A | $0.44 | 1m 12s |
| 38 | GPT-5.4 mini | SPA JS | 86% | 100% (+14%) | A | $0.21 | 51s |
| 39 | Claude Opus 4.6 | Vue | 100% | 100% | A | $0.53 | 1m 50s |
| 40 | Claude Opus 4.7 | Vue | 92% | 100% (+8%) | A | $0.48 | 1m 53s |
| 41 | Claude Sonnet 4.6 | Vue | 100% | 100% | A | $0.62 | 3m 1s |
| 42 | Gemini 3.1 Pro | Vue | 100% | 100% | A | $0.43 | 1m 7s |
| 43 | Claude Opus 4.6 | Android | 78% | 99% (+21%) | A | $0.36 | 1m 6s |
| 44 | Claude Opus 4.7 | Android | 78% | 99% (+21%) | A | $0.41 | 1m 39s |
| 45 | Claude Sonnet 4.6 | Android | 67% | 99% (+32%) | A | $0.49 | 2m 9s |
| 46 | Gemini 3.1 Pro | Android | 56% | 99% (+43%) | A | $0.61 | 1m 52s |
| 47 | Gemini 3.5 Flash | Android | 56% | 99% (+43%) | A | $0.53 | 1m 20s |
| 48 | Gemini 3.5 Flash | Express API | 77% | 99% (+22%) | A | $0.78 | 2m 4s |
| 49 | Gemini 3.1 Pro | Flask | 36% | 99% (+63%) | A | $0.72 | 1m 41s |
| 50 | Gemini 3.5 Flash | Next.js | 64% | 99% (+35%) | A | $1.04 | 1m 57s |
| 51 | GPT-5.4 mini | Next.js | 79% | 99% (+20%) | A | $1.23 | 2m 26s |
| 52 | GPT-5.4 | Next.js | 86% | 99% (+13%) | A | $2.71 | 2m 24s |
| 53 | GPT-5.4 mini | Nuxt | 35% | 99% (+64%) | A | $0.33 | 1m 22s |
| 54 | GPT-5.4 mini | React | 100% | 99% (-1%) | A | $0.35 | 1m 13s |
| 55 | GPT-5.4 | React | 100% | 99% (-1%) | A | $0.76 | 1m 22s |
| 56 | GPT-5.4 | SPA JS | 100% | 99% (-1%) | A | $0.43 | 55s |
| 57 | GPT-5.4 mini | Vue | 100% | 99% (-1%) | A | $0.50 | 1m 55s |
| 58 | GPT-5.4 | Vue | 100% | 99% (-1%) | A | $0.99 | 2m 1s |
| 59 | GPT-5.4 mini | Android | 33% | 98% (+65%) | A | $0.84 | 2m 23s |
| 60 | GPT-5.4 | Android | 56% | 98% (+42%) | A | $1.69 | 2m 14s |
| 61 | GPT-5.4 | Express | 87% | 98% (+11%) | A | $1.00 | 1m 54s |
| 62 | Claude Opus 4.7 | FastAPI | 60% | 98% (+38%) | A | $0.54 | 1m 22s |
| 63 | Claude Sonnet 4.6 | Flask | 21% | 98% (+77%) | A | $0.44 | 1m 49s |
| 64 | Gemini 3.5 Flash | Flask | 36% | 98% (+62%) | A | $1.86 | 2m 10s |
| 65 | GPT-5.4 mini | Flask | 36% | 98% (+62%) | A | $0.34 | 1m 38s |
| 66 | GPT-5.4 | Flask | 43% | 98% (+55%) | A | $1.25 | 2m 25s |
| 67 | Gemini 3.1 Pro | Next.js | 64% | 98% (+34%) | A | $0.55 | 1m 59s |
| 68 | Gemini 3.1 Pro | Nuxt | 55% | 98% (+43%) | A | $1.02 | 2m 3s |
| 69 | Gemini 3.5 Flash | Vue | 100% | 98% (-2%) | A | $0.78 | 1m 46s |
| 70 | Claude Opus 4.8 | Android | 77.8% | 97% (+19.2%) | A | $0.76 | 1m 49s |
| 71 | GPT-5.4 | Angular | 100% | 97% (-3%) | A | $1.46 | 2m 22s |
| 72 | Claude Haiku 4.5 | Express API | 62% | 97% (+35%) | A | $0.17 | 57s |
| 73 | Gemini 3.5 Flash | Fastify API | 36% | 97% (+61%) | A | $0.46 | 1m 15s |
| 74 | GPT-5.4 | Fastify API | 43% | 97% (+54%) | A | $1.11 | 1m 9s |
| 75 | Claude Opus 4.8 | Next.js | 78.6% | 97% (+18.4%) | A | $0.57 | 2m 6s |
| 76 | Claude Haiku 4.5 | Nuxt | 35% | 97% (+62%) | A | $0.24 | 1m 33s |
| 77 | GPT-5.4 | Nuxt | 35% | 97% (+62%) | A | $2.31 | 4m 8s |
| 78 | Claude Haiku 4.5 | React | 100% | 97% (-3%) | A | $0.25 | 1m 13s |
| 79 | Claude Opus 4.7 | Swift | 60% | 97% (+37%) | A | $0.58 | 1m 38s |
| 80 | Claude Haiku 4.5 | Android | 67% | 96% (+29%) | A | $0.20 | 55s |
| 81 | Claude Sonnet 4.6 | Angular | 100% | 96% (-4%) | A | $0.70 | 3m 51s |
| 82 | GPT-5.4 mini | Angular | 100% | 96% (-4%) | A | $1.04 | 2m 23s |
| 83 | Claude Haiku 4.5 | Express | 47% | 96% (+49%) | A | $0.25 | 1m 15s |
| 84 | Claude Opus 4.8 | Express | 80% | 96% (+16%) | A | $0.32 | 1m 55s |
| 85 | Claude Opus 4.6 | Flask | 43% | 96% (+53%) | A | $0.43 | 1m 18s |
| 86 | Claude Opus 4.7 | Nuxt | 50% | 96% (+46%) | A | $1.21 | 4m 5s |
| 87 | Gemini 3.1 Pro | Swift | 80% | 96% (+16%) | A | $0.42 | 1m 5s |
| 88 | Gemini 3.1 Pro | FastAPI | 0% | 95% (+95%) | A | $0.65 | 1m 29s |
| 89 | Claude Haiku 4.5 | Flask | 43% | 95% (+52%) | A | $0.17 | 1m 0s |
| 90 | Claude Opus 4.8 | Flask | 28.6% | 95% (+66.4%) | A | $0.53 | 1m 39s |
| 91 | Claude Haiku 4.5 | Vue | 85% | 95% (+10%) | A | $0.25 | 2m 24s |
| 92 | Gemini 3.5 Flash | Swift | 80% | 95% (+15%) | A | $0.78 | 1m 33s |
| 93 | GPT-5.4 | Swift | 70% | 95% (+25%) | A | $0.92 | 1m 58s |
| 94 | GPT-5.4 mini | FastAPI | 33% | 94% (+61%) | A | $0.26 | 54s |
| 95 | Claude Haiku 4.5 | Fastify API | 43% | 94% (+51%) | A | $0.07 | 27s |
| 96 | GPT-5.4 mini | Swift | 60% | 94% (+34%) | A | $0.25 | 1m 5s |
| 97 | GPT-5.4 | FastAPI | 47% | 93% (+46%) | A | $0.62 | 1m 6s |
| 98 | Claude Haiku 4.5 | SPA JS | 93% | 93% | A | $0.13 | 59s |
| 99 | Claude Haiku 4.5 | Angular | 100% | 92% (-8%) | A | $0.54 | 5m 50s |
| 100 | Claude Haiku 4.5 | FastAPI | 40% | 92% (+52%) | A | $0.10 | 41s |
| 101 | Claude Opus 4.6 | FastAPI | 47% | 92% (+45%) | A | $0.44 | 1m 16s |
| 102 | Claude Sonnet 4.6 | FastAPI | 47% | 92% (+45%) | A | $0.33 | 1m 33s |
| 103 | Claude Opus 4.7 | SPA JS | 100% | 92% (-8%) | A | $0.39 | 1m 26s |
| 104 | Claude Haiku 4.5 | Swift | 70% | 92% (+22%) | A | $0.14 | 38s |
| 105 | Claude Opus 4.6 | Swift | 70% | 92% (+22%) | A | $0.44 | 1m 0s |
| 106 | Claude Opus 4.8 | Swift | 70% | 92% (+22%) | A | $0.66 | 1m 19s |
| 107 | Claude Sonnet 4.6 | Swift | 70% | 92% (+22%) | A | $0.43 | 2m 18s |
| 108 | Claude Opus 4.8 | FastAPI | 57.1% | 91% (+33.9%) | A | $0.42 | 1m 54s |
| 109 | GPT-5.4 mini | Express | 87% | 90% (+3%) | B | $0.70 | 2m 36s |
| 110 | Claude Opus 4.8 | Fastify API | 76.9% | 89% (+12.1%) | B | $0.47 | 1m 56s |
| 111 | Claude Opus 4.8 | Vue | 100% | 100% | A | $0.76 | 1m 50s |
| 112 | GPT-5.4 | Express API | 77% | 88% (+11%) | B | $0.60 | 1m 20s |
| 113 | GPT-5.4 mini | Express API | 85% | 86% (+1%) | B | $0.42 | 2m 0s |
| 114 | Gemini 3.5 Flash | FastAPI | 33% | 85% (+52%) | B | $2.23 | 1m 35s |
| 115 | Gemini 3.1 Pro | Fastify API | 29% | 84% (+55%) | B | $0.15 | 43s |
| 116 | GPT-5.4 mini | Fastify API | 43% | 84% (+41%) | B | $0.29 | 48s |
| 117 | Claude Opus 4.8 | Nuxt | 25% | 81% (+56%) | B | $1.41 | 6m 40s |

## Methodology

### 1. Real integration tasks
We test each model with realistic developer prompts — the kind you'd actually type when building an app. No optimized instructions, no guided walkthroughs.

### 2. Automated grading
Every response is scored across multiple dimensions: correct SDK usage, proper configuration, security best practices, and more. Grading is deterministic and reproducible.

### 3. Tool comparison
Each model runs twice: once with just its training knowledge (baseline), and once with Auth0's MCP Server and Agent Skills enabled. The delta measures the real-world impact of Auth0's developer platform.

## Developer Tools

### Auth0 MCP Server
Connect AI agents directly to Auth0 for real-time tenant management.

[Documentation](https://auth0.com/docs/get-started/build-with-ai-tools#auth0-docs-mcp-server)

### Auth0 Agent Skills
Pre-built implementation knowledge for AI coding agents.

[GitHub Repository](https://github.com/auth0/agent-skills)

## Grade Scale

- **A** (90-100%): Production-ready implementation
- **B** (75-89%): Good with minor issues
- **C** (60-74%): Functional but needs review
- **D** (<60%): Significant issues

*Last updated: June 2026*
