Grok 4.7は長い仕事に強くなった。気になるのはトークン消費

スナック3行まとめ

  • Grok 4.7は、長時間にわたるコーディングやオフィス業務を続けて進める性能が向上しました。
  • 独立評価のArtificial Analysisでも、コーディングエージェントと文書・表計算・スライド作成の成績が伸びています。
  • ただし全テストで首位ではなく、Artificial Analysisの測定では出力トークンを多く消費しています。

Grok 4.7で改善が最もはっきりしているのは、長いコーディングやオフィス業務を粘り強く進める力です。一方で、競合を上回れないテストもあり、出力トークンの消費も多め。長い仕事を任せる候補にはなりますが、単価だけで安く済むとは決められません。

SpaceXAIが公開したGrok 4.7の料金と7項目の性能比較表
SpaceXAIが公開したGrok 4.7と比較モデルの料金・性能表。メーカー公表値であり、独立したランキングではありません。画像:SpaceXAI。

スナックガールズのひとこと

AIKO: 単価表だけなら軽い請求に見えても、出力が積み上がると話は別です。私なら「解決した1件」の請求額を並べます。トークンにも大盛りはありますから。

ネア: 最初に決めた方針を、最後のファイルを直すまで覚えていてくれるかが気になります。長い修正で設定や命名が少しずつずれないなら、続きを任せたくなりそうです。

長いコーディングで伸びる。ただし推論設定も見る必要がある

SpaceXAIのモデルカードは、Grok 4.7を従来モデルより長く難しいコーディング、エンジニアリング、オフィス業務を自律的に進めるためのモデルと位置づけています。同社が挙げる改善の理由は、ベースモデルの大型化、数時間かかる難しい課題での強化学習の長期化、自己検証の強化、長いコンテキストの管理改善です。

SpaceXAI公表の比較表では、CursorBench 4.0がGrok 4.6 Highの40.4%からGrok 4.7 xHighの46.3%に上昇。DeepSWE v1.1は65.2%から71.0%、Terminal-Bench 4.0は20.3%から38.0%となっています。

ただし、この表ではGrok 4.7がxHigh、Grok 4.6がHighという比較が多く、推論に使う労力がそろっているとは限りません。DeepSWEのGrok 4.7はhighですが、表全体の数値差をすべて同条件の性能差として扱うのは避けたいところです。Terminal-Benchの伸びも、そのままモデル本来の能力が倍増した証拠にはなりません。

設定の影響を見る手がかりは、同じGrok 4.7での比較です。公式モデルカードのCursorBench 4.0では、highが43.9%、xHighが46.3%。なお、CursorBench 4.0と旧版3.2の結果は直接比較できません。

独立評価でも、文書・表計算・スライド作成が伸びた

Artificial Analysisでは、Grok Buildを使ったGrok 4.7 xHighのCoding Agent Indexは56。Grok 4.6 xHighから9ポイント上がり、各モデル専用の実行環境で評価されたシステムの中で4位でした。

オフィス業務でも、AA-Briefcaseは1657 EloでGrok 4.6 highから111上昇、GDPval-AAは1695 Eloで90上昇しています。これらが扱うのは、数時間を要する文書、スプレッドシート、プレゼンテーションなどの成果物を作る仕事です。Eloは相対的な評価値で、正答率や完成率を示すパーセントではありません。

50万トークンのコンテキストウィンドウは、大きなコードベースや大量の文書を扱う際に役立つ容量です。ただし、これはGrok 4.6から変わっていません。今回の新しさは容量の拡大ではなく、長い作業を進める性能の改善にあります。

全項目トップではない。単価と作業総額も別の話

SpaceXAI公表の表でも、CursorBench 4.0はFable 5.1 Maxが51.8%、Terminal-Bench 4.0は同モデルが57.9%で、Grok 4.7を上回ります。DeepSWE v1.1もGPT-5.6 Sol Maxが72.7%で、Grok 4.7の71.0%より高い結果です。

独立評価でも、Artificial Analysisの総合的なIntelligence Indexは46でした。同社は、エージェント型の知識労働以外では改善は比較的小さく、評価項目によって向上と後退の両方があるとしています。

さらに同社のIntelligence Indexでは、1タスクあたりの出力がGrok 4.7 xHighで約81,000トークン。Grok 4.6 highは約36,000、GPT-6 Astra maxは約27,000でした。異なる推論設定での測定であり、どの仕事でも同じ量になるわけではありませんが、出力の多さは費用を見るうえで無視できません。

SpaceXAIによると、トークン料金の開始水準はGrok 4.6と同じです。それでも、トークン単価が低いことと、仕事を1件終える総額が低いことは別。多くのトークンを使うなら、単価だけでは費用を判断できません。

試すなら、複数ファイルの修正や長い成果物づくりから

評価の候補にしやすいのは、複数ファイルにまたがるコーディング、ターミナルを使う長時間のエージェント作業、文書や表計算資料を仕上げる仕事です。短いチャットやトークン消費を抑えたい用途は、分けて測るのがよさそうです。

普段の仕事に近い課題を使い、最後まで完了できた割合、人が直した回数、完了までの時間、総トークン使用量、解決できた1件あたりの費用を比べてみてください。長い作業を任せたときに、追加の消費に見合うだけ手直しが減るかどうかが、選ぶ際の具体的な基準になります。

出典・日付: 2026年9月22日

関連ハッシュタグ
#GameSunakku #AI #Grok47 #GitHubCopilot #AICoding #AIBenchmark #AgenticAI

Game Sunakku에서 더 알아보기

지금 구독하여 계속 읽고 전체 아카이브에 액세스하세요.

계속 읽기