掘り出し物LLMを、
数値で見つける。
OpenRouter上のマイナー寄りモデルを、日本語タスクで継続ベンチマーク。 スコア・コスト・速度を可視化して、本命と掘り出し物をデータで比較できます。
検証済みモデル
5
ベンチタスク
21
実行ラン
162
累計コスト
$0.01
📅 最終更新: 2026-06-25 (DeepSeek: DeepSeek V4 Flash) · judge不一致 12%
🏆 性能ランキング
日本語チャット性能とエージェントコーディング性能を分けて表示
💬 チャット
データがありません
🛠 エージェント
データがありません
🛡 信頼性 & 速度ランキング
スコアだけでなく「安定して動くか・速いか」で並べた実用観点のランキング
| # | モデル | 信頼性 | 成功率 | 速度 | 平均 レスポンス | p95 | ラン数 |
|---|---|---|---|---|---|---|---|
| 1 | openrouter/owl-alpha | A | 100% | ⏱️ 中速 | - | - | 42 |
| 2 | google/gemma-4-31b-it:free | A | 100% | ⏱️ 中速 | - | - | 42 |
| 3 | openai/gpt-oss-120b:free | B | 100% | ⏱️ 中速 | - | - | 38 |
| 4 | deepseek/deepseek-v4-flash | B | 100% | ⏱️ 中速 | - | - | 40 |
💰 コストパフォ散布図
横軸: 累計コスト($) / 縦軸: スコア。右上のモデルが「安くて高性能」
💎 コスト効率ランキング (スコア/$)
同じ1ドルで何点取れるか。無料モデルは無限大扱い
データがありません
📝 最新の検証記事
note / X での発信は /publications にまとめてあります。