스낵 3줄 요약
- Grok 4.7은 오래 이어지는 코딩·사무 작업을 끝까지 수행하는 능력이 개선됐습니다.
- 독립 평가에서도 문서·스프레드시트·발표 자료를 만드는 에이전트 업무 성적이 올랐습니다.
- 다만 모든 시험에서 선두는 아니며, Artificial Analysis 평가에서는 출력 토큰을 많이 사용했습니다.
Grok 4.7에서 가장 눈에 띄는 변화는 긴 코딩과 사무 작업을 이어 가는 능력입니다. 공식 성적표와 독립 평가 모두 이 영역의 개선을 보여주지만, 경쟁 모델을 전부 앞선 것은 아닙니다. 실제 업무에 쓸 때는 결과물을 얼마나 잘 완성하는지와 함께, 그 과정에서 토큰을 얼마나 쓰는지도 살펴야 합니다.

스낵걸즈 한마디
AIKO: 토큰 단가표 옆에 작업당 사용량도 띄워 두고 싶습니다. 단가는 작은데 청구서는 커지는 조합, 계산에서 빼놓을 수 없죠.
네아: 저는 여러 파일을 고친 뒤에도 처음 정한 방향을 끝까지 지키는지 궁금해요. 마지막 수정이 앞서 만든 코드와 자연스럽게 이어지는지 보고 싶네요.
긴 코딩 성적은 올랐다, 추론 설정은 나눠 봐야 한다
SpaceXAI는 더 큰 기반 모델을 사용하고, 수 시간이 걸리는 어려운 과제로 강화학습을 더 오래 진행했다고 설명합니다. 자체 검증과 긴 문맥 관리도 강화했다는 것이 회사가 밝힌 개선 배경입니다.
SpaceXAI가 공개한 출시 비교표에서 Grok 4.7의 CursorBench 4.0 점수는 xHigh 설정 기준 46.3%로, Grok 4.6 High의 40.4%보다 높습니다. 다만 모델 버전뿐 아니라 추론 노력 설정도 달라, 이 차이를 모델 교체 효과만으로 해석할 수는 없습니다. 같은 Grok 4.7을 비교한 모델 카드에서는 high가 43.9%, xHigh가 46.3%였습니다. CursorBench 4.0 점수는 이전 3.2 점수와 직접 비교할 수 없습니다.
같은 회사 비교표의 DeepSWE v1.1에서는 Grok 4.7 high가 71.0%, Grok 4.6이 65.2%를 기록했습니다. Terminal-Bench 4.0은 각각 38.0%와 20.3%입니다. 이 표는 여러 항목에서 추론 설정이 다르므로, 특히 터미널 점수만 보고 모델 자체 능력이 두 배가 됐다고 말하기는 어렵습니다.
독립 평가인 Artificial Analysis에서도 코딩 개선은 나타났습니다. Grok Build를 사용하는 Grok 4.7 xHigh는 Coding Agent Index에서 56점을 받아 Grok 4.6 xHigh보다 9점 올랐습니다. 각 모델의 자체 에이전트 실행 환경으로 평가한 시스템 가운데는 4위였습니다.
문서와 스프레드시트를 완성하는 업무에서도 개선
Artificial Analysis의 AA-Briefcase와 GDPval-AA는 문서, 스프레드시트, 발표 자료처럼 수 시간이 걸리는 실무 결과물을 만드는 능력을 다룹니다. 짧은 질문에 답하는 성적과 구분해서 볼 만한 평가입니다.
Grok 4.7은 AA-Briefcase에서 1657 Elo, GDPval-AA에서 1695 Elo를 기록했습니다. Grok 4.6 high 대비 각각 111점과 90점 상승한 수치입니다. Elo는 상대적인 평가 점수이며, 작업 성공률을 뜻하는 백분율은 아닙니다.
50만 토큰의 문맥 창은 큰 코드베이스나 많은 문서를 한꺼번에 다룰 때 활용할 수 있습니다. 다만 이 용량은 Grok 4.6과 같습니다. 이번에 새로 늘어난 용량이 아니라, 같은 긴 문맥을 얼마나 잘 관리하며 작업을 이어 가는지가 개선을 살펴볼 지점입니다.
전체 선두는 아니고, 낮은 토큰 단가만 볼 수도 없다
SpaceXAI의 비교표에서도 경쟁 모델이 앞선 항목이 있습니다. Fable 5.1 Max는 CursorBench 4.0에서 51.8%, Terminal-Bench 4.0에서 57.9%로 Grok 4.7보다 높았습니다. DeepSWE v1.1에서는 GPT-5.6 Sol Max가 72.7%로 앞섰습니다.
Artificial Analysis의 종합 Intelligence Index 점수는 46입니다. 이 기관은 에이전트가 수행하는 지식 업무 밖에서는 개선 폭이 비교적 작고, 세부 항목별로 상승과 하락이 함께 나타났다고 설명합니다. 긴 작업에서의 성과를 모든 용도의 우위로 넓혀 받아들이기는 어렵습니다.
출력 토큰 사용량도 주의할 부분입니다. Artificial Analysis의 Intelligence Index 평가에서 과제당 출력은 Grok 4.7 xHigh가 약 8만 1,000토큰, Grok 4.6 high가 약 3만 6,000토큰, GPT-6 Astra max가 약 2만 7,000토큰이었습니다. 서로 다른 추론 설정에서 측정된 값이며, 모든 실무 작업이 이만큼의 토큰을 쓴다는 뜻은 아닙니다.
SpaceXAI는 시작 토큰 요금과 서비스 속도가 Grok 4.6과 같다고 밝혔습니다. 하지만 토큰당 단가가 낮더라도 출력량이 많아지면 작업 한 건의 비용은 커질 수 있습니다. 단가만으로 가장 저렴한 선택이라고 단정할 수 없는 이유입니다.
여러 파일을 고치는 실제 과제부터 비교해 볼 만하다
Grok 4.7을 시험할 우선 후보는 여러 파일에 걸친 코드 수정, 오래 이어지는 터미널·에이전트 작업, 문서 결과물을 만드는 업무입니다. 짧은 채팅이나 토큰 예산이 빠듯한 작업은 별도로 측정하는 편이 좋습니다.
비교할 때는 같은 과제를 맡기고 완료율, 사람이 고쳐야 했던 부분과 횟수, 완료까지 걸린 시간, 전체 토큰 사용량, 해결한 작업 한 건당 비용을 함께 기록해 보세요. 긴 작업을 잘 끝내는 이점이 자신의 업무에서도 추가 토큰 사용을 감수할 만큼 큰지 확인할 수 있습니다.
출처 및 날짜: 2026년 9월 22일 KST