AI News글자 수 3142읽는 시간8

Grok 4.6, 더 적은 도구 턴과 고정 API 가격으로 장기 실행 에이전트 겨냥

SpaceXAI의 Grok 4.6은 장기 지평 에이전트 벤치마크를 개선하고, $2/$6 가격을 유지하며, 500,000토큰 API 컨텍스트를 제공한다.

SpaceXAI는 8월 12일 Grok 4.6을 출시하며, 주제를 조사하고, 코드베이스 전반에서 작업하며, 도구를 사용하고, 여러 단계에 걸쳐 작업을 다듬는 장기 실행 에이전트를 겨냥했다고 밝혔다. 이 릴리스는 주요 API 가격을 입력 토큰 100만 개당 $2, 출력 토큰 100만 개당 $6으로 유지하면서 여러 에이전트 평가에서 Grok 4.5보다 상당히 개선됐다.

가장 두드러진 결과는 장기 지평 지식 작업을 위한 Artificial Analysis의 AA-Briefcase 벤치마크에서 나왔다. Grok 4.6은 평가 전반에서 약 53턴과 약 5억 개의 입력 토큰으로 작업을 완료했다. 이는 최고 노력 설정의 Claude Opus 5가 약 103턴과 20억 개의 입력 토큰을 사용한 것과 비교된다. 이 비교는 구체적인 효율성 주장을 뒷받침한다. 이 벤치마크에서 Grok은 약 절반의 턴과 4분의 1의 입력 토큰만 필요했다.

이 결과는 Grok 4.6이 “다른 선도 모델”의 절반 턴을 사용한다는 최초의 소셜 미디어 설명보다 범위가 좁다. Artificial Analysis는 모든 경쟁 프런티어 모델이 아니라 Claude Opus 5 Max와의 상세 비교를 공개했다. 그럼에도 장기 에이전트 루프는 컨텍스트를 반복적으로 재전송하거나 누적하므로, 단계 수가 지연 시간과 비용의 직접적인 구성 요소가 된다는 점에서 중요하다.

1. Grok 4.6은 Grok 4.5 학습 계보를 확장한다

SpaceXAI는 Grok 4.6을 새로 공개된 아키텍처가 아니라 Grok 4.5의 연장선으로 설명한다. 회사는 이번 릴리스의 파라미터 수, 학습 연산량 수치 또는 상세 아키텍처 사양을 공개하지 않았다.

이 모델은 Grok 4.5보다 더 긴 추가 학습을 받았다. SpaceXAI에 따르면 이 단계에는 추론 및 고급 기술 개념을 위한 큐레이션된 모델 생성 자료, 고품질 엔지니어링 데이터, 개선된 옵티마이저와 학습 레시피가 사용됐다.

그 뒤 Grok 4.5는 여러 추론 노력 설정, 에이전트 하니스, 그리고 STEM, 소프트웨어 엔지니어링, 지식 작업을 포함한 도메인 전반에서 지도 미세 조정 궤적을 재생성하는 데 사용됐다. 모델 기반 검사가 문제가 있는 궤적을 걸러낸 뒤, 결과 체크포인트는 강화학습을 거쳤다.

강화학습 환경은 일반 코딩 및 지식 작업뿐 아니라 커널 최적화, 웹 개발, 컴퓨터 지원 설계와 관련된 더 전문적인 작업도 포함했다. SpaceXAI는 더 긴 테스트 궤적이 모델이 작업을 계속하기 전에 자체 작업을 테스트하고 검증하는 사례도 더 많이 만들었다고 밝혔다.

Cursor 데이터는 이 모델 계보에 속하지만, 공개된 내용은 신중한 표현을 요구한다. Cursor는 Grok 4.5가 수조 개 토큰 규모의 Cursor 데이터를 사용한 전문가 혼합 모델로 SpaceXAI와 공동 학습됐다고 밝혔다. 이 자료는 코드베이스 상호작용과 개발자, 에이전트, 소프트웨어 도구 간의 교환을 모두 포착했다.

Grok 4.6 발표는 새 모델이 Grok 4.5를 기반으로 하며 추가 엔지니어링 데이터를 받았다고 말하지만, 4.6에만 해당하는 새 Cursor 데이터가 얼마나 추가됐는지는 수치로 밝히지 않는다. Grok 4.6이 Cursor로 학습된 기반의 혜택을 받는다고 설명하는 것은 뒷받침되지만, 4.6 추가 학습에 대해 새롭게 공개된 Cursor 데이터 규모가 있다고 주장하는 것은 그렇지 않다.

2. 에이전트 벤치마크는 큰 향상을 보이지만, 완승은 아니다

Grok 4.6은 Artificial Analysis Intelligence Index 4.1.1 버전에서 61점을 기록했다. 이는 Grok 4.5보다 5점 높고 SpaceXAI의 출시 비교에서 GPT-5.6 Sol Max와 같다. Fable 5 Max는 62점을 기록했다. 이 지수는 에이전트 작업, 터미널 작업, 과학, 일반 지식, 추론을 포괄하는 9개 평가를 결합한다.

이 릴리스의 가장 뚜렷한 개선은 에이전트 지향 테스트에서 나타난다.

평가Grok 4.6 HighGrok 4.5 HighGPT-5.6 Sol MaxFable 5 Max
GDPVal-AA v21,7531,5261,7281,741
CursorBench v3.269.9%66.7%67.2%70.5%
DeepSWE v1.165.9%54.0%73.0%70.0%
FrontierCode v1.1 Extended61.3%56.6%60.6%63.6%
APEX-Agents57.5%47.1%56.7%59.2%
Terminal-Bench v3.026.0%15.7%34.6%34.1%
AA-Briefcase1,5771,3131,5021,574

GDPVal-AA v2는 경제적 가치가 있는 전문 업무를 평가한다. Artificial Analysis는 Grok 4.6의 결과가 Claude Opus 5에만 뒤졌으며, 신뢰 구간이 겹쳤기 때문에 Fable 5와 Qwen3.8 Max와는 통계적으로 구별되지 않는다고 독립적으로 보고했다.

AA-Briefcase는 더 이례적인 효율성 프로파일과 함께 유사한 품질 결과를 냈다. Grok 4.6은 Elo 레이팅 1,577에 도달했으며, 이는 SpaceXAI 표에 표시된 Fable 5 Max의 1,574보다 약간 높고 GPT-5.6 Sol Max의 1,502보다 상당히 높다. Artificial Analysis는 Grok의 출력이 루브릭 준수, 표현, 분석 품질 전반에서 일관되게 경쟁력 있다고 평가했다.

이 결과가 Grok 4.6이 모든 에이전트 워크로드에서 가장 강력한 모델임을 입증하는 것은 아니다. GPT-5.6 Sol Max는 DeepSWE v1.1에서 7.1퍼센트포인트, Terminal-Bench v3.0에서 8.6포인트 앞섰다. Fable 5 Max도 출시 표에서 CursorBench, FrontierCode, APEX-Agents, Terminal-Bench, APEX-SWE에서 앞섰다.

벤치마크 조건은 하니스와 추론 설정에 따라 다르며, SpaceXAI는 경쟁 수치가 공급업체가 공개한 시스템 카드 또는 공개 리더보드에서 선택됐다고 언급한다. 따라서 이 표는 여러 환경에서의 경쟁력 있는 성능을 보여주는 증거이지, 하나의 모델이 모든 에이전트 시스템을 지배한다는 통제된 선언은 아니다.

3. 더 적은 턴 수는 비용 계산을 바꾼다

Artificial Analysis는 Intelligence Index에서 Grok 4.6을 평가하는 동안 작업당 평균 비용을 $0.84로 측정했다. 이 지수에 포함된 각 에이전트 평가에서 이 모델을 비용 대비 성능 프런티어에 위치시켰다.

경제적 이점은 두 가지 별도 요인에서 나온다. Grok 4.6은 인접한 여러 프런티어 모델보다 공개 토큰 가격이 낮고, AA-Briefcase 실행은 더 적은 턴을 사용했기 때문에 누적 컨텍스트도 더 적었다. 장기 실행 에이전트는 각 작업 후 지침, 대화 기록, 검색된 문서, 도구 결과를 모델에 다시 전송할 수 있다. 따라서 최종 답변이 유사하더라도 사이클 수를 줄이면 입력 토큰 소비량을 낮출 수 있다.

이것이 모든 Grok 4.6 애플리케이션의 비용이 $0.84이거나 절반의 턴을 사용한다는 뜻은 아니다. 이 수치는 Artificial Analysis의 평가 구성에 관한 것이다. 실제 비용은 추론 노력, 도구 설계, 프롬프트 캐싱, 컨텍스트 증가, 재시도, 그리고 에이전트가 작업을 성공적으로 완료하는지 여부에 따라 달라진다.

순수 속도는 또 다른 한계다. Artificial Analysis는 SpaceXAI의 API를 통해 초당 약 62개의 출력 토큰과 첫 토큰까지 44.82초를 측정했으며, 둘 다 모델 페이지에 표시된 비교 중앙값보다 느렸다. 턴 효율성은 각 개별 응답을 빠르게 만들지 않으면서도 전체 워크플로의 소요 시간을 줄일 수 있다.

4. API와 Cursor 배포에는 서로 다른 제한이 있다

네이티브 SpaceXAI API는 모델 식별자 grok-4.6을 사용한다. 텍스트와 이미지를 입력으로 받고, 텍스트를 반환하며, 기본값인 high를 포함해 low, medium, high, xhigh 추론 노력을 지원한다. 문서화된 도구에는 함수 호출, 웹 및 X 검색, 코드 실행이 포함된다.

SpaceXAI는 500,000토큰 컨텍스트 윈도우, 2026년 2월 1일 지식 컷오프, 그리고 명시된 텍스트 출력 제한 없음으로 문서화하고 있다. 프롬프트 토큰이 200,000개 미만일 때 API 가격은 입력 토큰 100만 개당 $2, 캐시된 입력 토큰 100만 개당 $0.50, 출력 토큰 100만 개당 $6이다. 프롬프트가 200,000토큰을 초과하면 이 요금은 각각 $4, $1, $12로 두 배가 된다.

회사는 연속 요청이 같은 서버에 도달해 캐시된 컨텍스트를 재사용할 수 있도록 대화에 안정적인 프롬프트 캐시 키를 할당할 것을 권장한다. 또한 장기 에이전트 루프를 위한 컨텍스트 압축도 권장한다. 광고된 컨텍스트 용량이 증가하는 기록을 반복 처리하는 비용을 없애지는 않기 때문에 두 메커니즘 모두 중요하다.

Cursor의 배포는 문서상 더 작은 256,000토큰 컨텍스트 윈도우를 제공한다. Grok 4.6에 Cursor의 파일 검색, 웹 접근, 파일 읽기 및 편집, 터미널, 브라우저, 이미지 생성, 규칙 검색 도구를 제공한다. 표준 온디맨드 요금은 더 낮은 API 티어와 같으며, Cursor의 Fast 옵션은 입력 토큰 100만 개당 $4, 캐시된 입력 토큰 100만 개당 $1, 출력 토큰 100만 개당 $12이다.

출시 시점에 Grok 4.6은 Cursor, Grok Build, SpaceXAI API, OpenRouter, Vercel, Cloudflare를 통해 제공됐다. Cursor와 Grok Build는 첫 주 동안 포함 사용량을 두 배로 제공했지만, 이는 영구적인 가격 조건이 아니라 기간 한정 출시 프로모션이었다.

자주 묻는 질문

Grok 4.6은 언제 출시됐나요?

SpaceXAI는 2026년 8월 12일 Grok 4.6을 출시했다.

Grok 4.6은 항상 절반의 에이전트 턴을 사용하나요?

아니다. 약 53턴 대 103턴 비교는 Claude Opus 5 Max를 상대로 한 Artificial Analysis의 AA-Briefcase 평가에서만 나온 결과다.

Grok 4.6은 Cursor 데이터로 학습됐나요?

Grok 4.5 기반 모델은 수조 개 토큰 규모의 Cursor 데이터로 학습됐다. SpaceXAI는 Grok 4.6 추가 학습에 구체적으로 얼마나 많은 Cursor 데이터가 사용됐는지, 또는 사용됐는지 여부를 공개하지 않았다.

Grok 4.6 API 비용은 얼마인가요?

프롬프트 토큰이 200,000개 미만일 때 문서화된 요금은 입력 토큰 100만 개당 $2, 캐시된 입력 토큰 100만 개당 $0.50, 출력 토큰 100만 개당 $6이다. 이 임계값을 넘으면 요금은 두 배가 된다.

Grok 4.6은 Cursor와 API에서 같은 컨텍스트 윈도우를 제공하나요?

아니다. SpaceXAI는 API에 500,000토큰을 문서화하고 있으며, Cursor는 배포 환경에 256,000토큰 컨텍스트 윈도우를 문서화하고 있다.

참고 자료

Share

이 글 공유