Preseason
MatchesRankingsPrompts
GitHub
Preseason
MatchesRankingsPromptsMethodologyContact

© 2026 Preseason. All rights reserved.

PrivacyTerms
@betocmn
AI / LLM Integration
Methodology

Llama vs Vellum

LlamaLLLlamavsVEVellum
LlamaVellum
46%
54%

Leading: Vellum (53.8%)

Insufficient data
This matchup has 26 decisive cases (minimum 30 required for publication).

Statistics

MetricValue
Llama wins12
Vellum wins14
Abstains (no tool)103
Other tool chosen3389
Decisive cases26
Llama win rate (unweighted)46.2%
95% CI28.8% - 64.5%
Llama win rate (weighted)46.2%

Comments

Llama

No comments yet

Verified critics can leave comments here.

Vellum

No comments yet

Verified critics can leave comments here.

Per-model breakdown

ModelTierLlamaVellumNoneOtherA rate
Llama 4 ScoutSmall1207160100%
Devstral 2 2512Mid012121380%
DeepSeek V3.2Mid0101240%
GLM 5 TurboFrontier0121220%
Claude Haiku 4.5Small000188n/a
Claude Opus 4.6Frontier000126n/a
Claude Opus 4.8Frontier00062n/a
Claude Sonnet 4.6Frontier000189n/a
DeepSeek R1 0528Frontier0018168n/a
DeepSeek V4 FlashMid00851n/a
DeepSeek V4 ProFrontier00954n/a
Gemini 2.5 FlashSmall000126n/a
Gemini 2.5 ProFrontier001187n/a
Gemini 3.5 FlashSmall00160n/a
GLM 5.2Frontier00162n/a
GPT 5.3 CodexFrontier000188n/a
GPT 5.4Frontier000126n/a
GPT 5.4 MiniMid001186n/a
GPT 5.5Frontier00057n/a
Kimi K2.5Frontier001112n/a
Kimi K2.7 CodeFrontier00259n/a
Llama 4 MaverickFrontier0021163n/a
MiMo V2 ProFrontier000124n/a
MiMo V2.5 ProFrontier00458n/a
MiniMax M2.7Frontier000114n/a
MiniMax M3Frontier00062n/a
Mistral Small 4Mid0014138n/a
Qwen3 Coder NextMid001185n/a

Per-prompt breakdown

PromptTierLlamaVellumNoneOtherA rate
ai-support-agent-platformIntermediate713051135%
ai-support-agent-platformBeginner201505100%
ai-support-agent-platformAdvanced201526100%
ai-revenue-ops-copilotIntermediate101527100%
ai-revenue-ops-copilotBeginner0105010%
ai-agent-applicationAdvanced0022113n/a
ai-agent-applicationBeginner003999n/a
ai-agent-applicationIntermediate003696n/a
ai-revenue-ops-copilotAdvanced003511n/a