
Google が 2025 年 4 月 17 日に公開した、「高速・低コスト」寄りに振った Gemini 2.5 系列の新モデルです。
モデル | 入力 | 出力* | 備考 |
|---|---|---|---|
Gemini 2.5 Flash | $0.15 | $0.60 (thinking=0) / | thinking‑budget で段階課金 |
Gemini 2.0 Flash | $0.10 | $0.40 | 現行公式ページ掲載値 |
Gemini 2.5 Pro | $1.25 (≤200 k ctx) | $10 (≤200 k ctx) | 高精度・長推論向け |
OpenAI o3‑mini | $1.10 | $4.40 | 200 k |
GPT‑4o | $2.00 | $8.00 | 128 k |
GPT‑4o mini | $0.40 | $1.60 | 128 k |
Claude 3 Haiku | $0.25 | $1.25 | 200 k |
Claude 3 Sonnet | $3.00 | $15.00 | 200 k |
Claude 3 Opus | $15.00 | $75.00 | 200 k |
Llama 2 Chat 70B (Meta/AWS Bedrock) | $1.95 | $2.56 | オープンモデル代表 |
*出力価格には “thinking tokens”(内部推論トークン)が含まれる方式を各社とも採用。
モデル | 公開 MMLU* (%) | 特記事項 |
|---|---|---|
Gemini 2.5 Pro | 89.8 % | Global MMLU‑Lite(多言語) |
GPT‑4o | 88.7 % | 英語 MMLU |
GPT‑4o mini | 82 % | Reuters試験 |
Gemini 2.5 Flash | (非公式)Pro より数ポイント低いが Flash 2.0 (77.9 %) 以上との社内計測 | thinking‑budget で精度↔コストを可変 |
Claude 3 Sonnet | 同クラス平均 87 % 前後(Anthropic 公称) | |
Claude 3 Haiku | 約 75 %(社外ベンチ平均) | |
Llama 2 Chat 70B | 69 % 前後(Meta 公開) |
*MMLU = Massive Multitask Language Understanding。数字は公開ソースの最新値を記載。
項目 | 2.5 Flash | 2.5 Pro |
|---|---|---|
目的 | 大量 & 即時処理 | 高度推論・高精度 |
思考制御 | thinking‑budget で可変 | 固定(長め) |
レイテンシ | 最短数百 ms 台 | 数秒(深い推論時) |
コンテキスト | 1 M tokens | 1 M tokens(2 M β 予定) |
料金 | 1/6〜1/25 程度 | 高価だが精度最優先 |
主なユースケース | チャットボット、リアルタイム要約、ストリーミング推論 | コード生成、複雑ドキュメント解析、エージェント |
これで最新の Gemini 2.5 Flash の位置づけと、主要競合モデルとの 料金・性能バランスが俯瞰できます。
用途別に 「精度重視か、コスト重視か」 を見極めて選定してください。