2026 年 8 月、DeepSeek は V4-Flash-0731 を公開ベータ API に投入し、Claude Opus 4.8 は Anthropic コーディングスタックの天井ティアのままです。 選型表にモデル名を 1 つだけ書くと、予算超過とスループット低下を同時に招きがちです。本稿では 性能・公開 Benchmark・100 万 token 請求・Agent コーディング能力 を同軸で比較し、チームがそのまま使えるルーティング規則を示します。
2026 年の格局:オープン高速 vs クローズド推論
AI コーディングは「誰が最も賢いか」ではなく タスク深度 × 呼び出し頻度 × コンプライアンス の最適化です。
DeepSeek V4-Flash-0731 は MoE オープンウェイト + 極低単価 + Agent ツールチェーン。284B 総パラメータ、MIT ライセンス、OpenAI Responses API 対応——Codex CLI や Cursor Background Agent の 高頻度・長ループ 向け。
Claude Opus 4.8 は クローズド推論の天井 + Claude Code エコシステム。SWE-bench Verified トップティア、曖昧要件・横断ディレクトリ推論・マージ前アーキテクチャレビューに強い——品質は高いが token 単価と待ち時間も大きい。
コア比較
| 次元 | V4-Flash-0731 | Opus 4.8 |
|---|---|---|
| 定位 | 高スループット Agent ループ、バッチ PR | 複雑推論、アーキテクチャ、終審 |
| コンテキスト | ~1M | ~976K |
| ウェイト | MIT、セルフホスト可 | クローズド API のみ |
| 速度 | ~60+ tok/s | 品質優先 |
Benchmark
| Benchmark | V4-Flash | Opus 4.8 |
|---|---|---|
| SWE-bench Verified | ~79.0% | ~88.6% |
| Terminal-Bench 2.1 | 82.7 | 85.0 |
| DeepSWE | 54.4 | 58.0 |
| Agent Last Exam | 25.2 | 25.7 |
SWE-bench は移植性の高いアンカー。Agent 系は 自社リポジトリ A/B を必須に。
コーディング 5 シナリオ
| シナリオ | Flash | Opus | 推奨 |
|---|---|---|---|
| 単一ファイル fix | 3/3 | 3/3 | Flash |
| 8 ファイル refactor | 2/3 | 3/3 | Opus |
| Issue→PR | 2/3 | 3/3 | Flash+Opus 終審 |
| Legacy+ADR | 境界漏れ | 完全 | Opus |
| ログバッチ | 3× 速 | ROI 低 | Flash |
Flash が日常 70–85% をカバー。Opus は diff>500 行、auth/決済、連続 CI 失敗で昇格。
価格
| Flash | Opus | |
|---|---|---|
| Input/1M | $0.14 | $5.00 |
| Output/1M | $0.28 | $25.00 |
| 10M out/月 | ~$2.80 | ~$250 |
20 ループ/日×50K out → 月 ~30M out:Flash ~$8.4、Opus ~$750。Flash 主 + Opus エスカレーション が 2026 年の実務解。
結論
- 品質天井・複雑リポジトリ:Opus 4.8
- Agent 経済性・バッチ・セルフホスト:V4-Flash-0731
- 最適解:デュアルルーティング。節約分を Cloud Mac Runner とレビューゲートへ
ZavCloud Developer Infrastructure
Agent ループを安定した Cloud Mac ノードで実行
Flash で高頻度呼び出し、Mac mini で git・Xcode・Runner
1Gbps 専用回線、24×7 セルフホスト Runner