Grok 4.6 공개 — 같은 가격에 장시간 에이전트 작업을 겨냥한 업그레이드
출처: xAI (SpaceXAI)
원문: https://x.ai/news/grok-4-6
작성자: 팔복소프트-김팔복
한눈에 보기
- SpaceXAI(구 xAI)가 Grok 4.6을 공개했습니다. 더 큰 모델이 아니라 Grok 4.5와 같은 베이스에 후속 학습(post-training)을 강화한 업그레이드입니다.
- 컨텍스트 500K 토큰, 텍스트·이미지 입력을 지원하며 지식 컷오프는 2026년 2월 1일입니다.
- 가격은 입력 $2 / 출력 $6 (1M 토큰 기준)으로 Grok 4.5와 동일하고, 2배 가격의 fast 변형도 함께 발표됐습니다.
- API(grok-4.6), Grok Build 기본 모델, Cursor 전 요금제, OpenRouter·Vercel·Cloudflare에서 출시 당일부터 사용할 수 있습니다.
- 지능·에이전트 벤치마크는 크게 올랐지만, 코딩 벤치마크에서는 경쟁 모델에 뒤처지는 부분이 있습니다.
주요 내용
무엇이 달라졌나: 모델 크기가 아니라 학습 레시피
이번 릴리스는 베이스 모델을 키운 것이 아닙니다. 기존 파운데이션을 유지한 채 추가 학습 기간을 늘리고, supervised fine-tuning 데이터를 재생성하고, 에이전트 환경에서의 강화학습을 강화한 결과물입니다. 공식 발표는 파라미터 수를 밝히지 않았고, 모델 규모보다 학습 레시피가 핵심이라는 프레이밍을 유지하고 있습니다.
방향성도 명확합니다. 여러 단계를 거치는 작업에서 이탈 없이 태스크를 유지하는 장시간 에이전트, 그리고 코딩과 지식 노동(knowledge work)이 타깃입니다.
스펙과 API 변화
컨텍스트는 500,000 토큰이고, 텍스트와 이미지를 입력받아 텍스트를 출력합니다. reasoning_effort 파라미터에는 기존 low/medium/high에 더해 새로운 xhigh 레벨이 추가됐습니다. 다만 최대 출력 토큰 수치는 공식 문서 어디에도 명시되어 있지 않습니다.
벤치마크: 오른 곳과 밀리는 곳
Artificial Analysis Intelligence Index에서 61점을 기록해 Grok 4.5의 56점에서 상승했고, GPT-5.6 Sol Max와 동점입니다. GDPval-AA v2에서는 1753 Elo로 전작(1526)보다 크게 올라 발표 표에서 선두이고, AA-Briefcase에서도 앞섭니다.
반면 코딩 벤치마크인 DeepSWE v1.1은 65.9%로 세대 대비 11.9포인트 올랐지만 GPT-5.6 Sol Max(73%)에는 못 미칩니다. Terminal-Bench에서도 약점이 확인되며, 공개된 수치가 자체 보고 벤치마크라는 점도 감안해야 합니다.
정리하면 지식 노동·에이전트 계열 평가에서 강하고, 엔지니어링 팀이 가장 신경 쓰는 코딩 평가에서는 아직 경쟁 모델을 완전히 따라잡지 못한 그림입니다.
가격: 표면은 동결, 세부는 확인 필요
기본 요율은 입력 $2 / 출력 $6으로 Grok 4.5와 같지만, 이 가격은 프롬프트 200K 토큰까지만 적용됩니다. 그 선을 넘으면 초과분만이 아니라 요청 전체가 $4/$12의 롱컨텍스트 요율로 과금됩니다. 예를 들어 입력 25만 토큰짜리 요청은 10만 토큰 요청보다 크기는 2.5배지만 비용은 4배 이상이 됩니다. 캐시된 입력 요율도 $0.50으로 Grok 4.5의 $0.30보다 높게 책정됐습니다.
멀티턴 에이전트라면 prompt_cache_key(Responses API)나 x-grok-conv-id 헤더(Chat Completions)로 캐시 적중률을 높이고, 긴 툴 루프에는 컨텍스트 컴팩션 기능을 활용하라는 것이 xAI의 권장 사항입니다.
어디서 쓸 수 있나
API에서 grok-4.6으로 바로 사용할 수 있고, Grok Build의 기본 모델이며, Cursor 전 요금제에 탑재됐습니다. OpenRouter, Vercel, Cloudflare를 통한 라우팅도 지원됩니다. 출시 첫 주에는 Cursor에서 2배 사용량 프로모션도 진행됩니다.
정리
Grok 4.6은 모델을 키우는 대신 후속 학습에 투자해 장시간 에이전트 작업 성능을 끌어올린 릴리스입니다. 같은 헤드라인 가격에 성능이 올랐다는 점은 매력적이지만, 200K 토큰을 넘는 순간 요청 전체가 2배 요율로 넘어가는 과금 구조는 롱컨텍스트 에이전트를 만드는 개발자라면 반드시 계산에 넣어야 합니다. 코딩 벤치마크에서는 아직 경쟁 모델 대비 열세인 만큼, 자기 워크로드로 직접 검증해보는 것이 좋겠습니다.
- Grok
- xAI
- LLM
- AI에이전트
- API가격
아직 댓글이 없습니다.