Preseason
MatchesRankingsPrompts
GitHub
Preseason
MatchesRankingsPromptsMethodologyContact

© 2026 Preseason. All rights reserved.

PrivacyTerms
@betocmn
AI / LLM Integration
Methodology

Llama vs Vellum

LlamaLLLlamavsVEVellum
LlamaVellum
46%
54%

Leading: Vellum (53.8%)

Insufficient data
This matchup has 26 decisive cases (minimum 30 required for publication).

Statistics

MetricValue
Llama wins12
Vellum wins14
Abstains (no tool)93
Other tool chosen3342
Decisive cases26
Llama win rate (unweighted)46.2%
95% CI28.8% - 64.5%
Llama win rate (weighted)46.2%

Comments

Llama

No comments yet

Verified critics can leave comments here.

Vellum

No comments yet

Verified critics can leave comments here.

Per-model breakdown

ModelTierLlamaVellumNoneOtherA rate
Llama 4 ScoutSmall1206159100%
Devstral 2 2512Mid012121440%
DeepSeek V3.2Mid0101300%
GLM 5 TurboFrontier0121280%
Claude Haiku 4.5Small000185n/a
Claude Opus 4.6Frontier000132n/a
Claude Opus 4.8Frontier00053n/a
Claude Sonnet 4.6Frontier000186n/a
DeepSeek R1 0528Frontier0015168n/a
DeepSeek V4 FlashMid00743n/a
DeepSeek V4 ProFrontier00945n/a
Gemini 2.5 FlashSmall000132n/a
Gemini 2.5 ProFrontier002183n/a
Gemini 3.5 FlashSmall00151n/a
GLM 5.2Frontier00153n/a
GPT 5.3 CodexFrontier000185n/a
GPT 5.4Frontier000132n/a
GPT 5.4 MiniMid001183n/a
GPT 5.5Frontier00049n/a
Kimi K2.5Frontier001117n/a
Kimi K2.7 CodeFrontier00151n/a
Llama 4 MaverickFrontier0018162n/a
MiMo V2 ProFrontier000130n/a
MiMo V2.5 ProFrontier00449n/a
MiniMax M2.7Frontier000120n/a
MiniMax M3Frontier00053n/a
Mistral Small 4Mid0012137n/a
Qwen3 Coder NextMid001182n/a

Per-prompt breakdown

PromptTierLlamaVellumNoneOtherA rate
ai-support-agent-platformIntermediate713051135%
ai-support-agent-platformBeginner201507100%
ai-support-agent-platformAdvanced201526100%
ai-revenue-ops-copilotIntermediate101527100%
ai-revenue-ops-copilotBeginner0104990%
ai-agent-applicationAdvanced001898n/a
ai-agent-applicationBeginner003584n/a
ai-agent-applicationIntermediate003380n/a
ai-revenue-ops-copilotAdvanced004510n/a