블로그6분 읽기

그록 4.6이 내세운 건 AA 지수 61보다 오래 버티는 에이전트입니다

그록 4.6 High의 AA Intelligence Index는 61로 GPT-5.6 Sol Max와 같고, CursorBench는 69.9%인데 Terminal-Bench는 26%입니다. 앞선 축과 뒤진 축을 공식 표 숫자로 정리했습니다.

출시 48시간 반응만 보면 데모 경연처럼 보여요.

공식문은 방향을 다르게 잡았습니다. 그록 4.6은 4.5 위에 올린 모델이고, 초점은 오래 가는 에이전트와 더 욕심 난 시각·인터랙티브 작업이죠.

숫자도 그 방향입니다. 공식 표에서 그록 4.6 High의 AA Intelligence Index는 61로 GPT-5.6 Sol Max와 같은데, Terminal-Bench v3.0은 26%로 아직 뒤에 있어요.

한 줄로 이기는 표가 아니라, 어디서 앞이고 어디서 뒤인지가 갈리는 표입니다. 그 갈림부터 정리합니다.

그록 4.6 벤치마크, Cursor 블로그 평가 결과

그록 4.6에서 무엇이 바뀌었나요?

xAI 발표는 한 줄로 요약돼요. 복잡한 일을 여러 단계에 걸쳐 붙잡고 있으라는 겁니다. 조사, 분석, 코드베이스 작업, 아이디어를 실제 결과물로 만드는 일이요.

학습 과정도 그 초점에 맞춰져 있어요. 4.5보다 긴 보충 학습을 돌렸고, 추론·공학 데이터와 개선된 옵티마이저를 넣었습니다.

그다음 그록 4.5로 SFT 궤적을 다시 만들고, 에이전트 하네스와 STEM·소프트웨어·지식 업무 궤적에서 문제 있는 트레이스를 걸러냈죠.

강화학습 환경도 넓어요. 일반 코딩만이 아니라 커널 최적화, 웹 개발, CAD 같은 도메인 환경을 넣었다고 적었습니다. 데모가 게임과 웹사이트 쪽으로 쏟아진 이유가 랜덤이 아닐 수 있어요.

제공 경로도 곧 제품이에요. Cursor와 Grok Build에서 당일 열렸고, 첫 주 포함 사용량을 2배로 줬습니다. API와 OpenRouter, Vercel, Cloudflare에도 올라갔어요.

왜 오래 가는 에이전트가 초점인가요?

프론티어 경쟁이 "한 방 답"에서 "오래 가는 작업"으로 옮겨갑니다. 오픈AI의 GPT-5.6 빌더 가이드도 같은 말을 다른 회사에서 합니다. 더 긴 작업을 더 적은 토큰으로, 하네스를 크게 안 바꾸고도 되게 만들겠다는 쪽이죠.

그록 4.6이 강조한 행동도 그 축입니다. 넓은 제품 아이디어를 동작하는 1차로 만들고, 피드백을 여러 라운드 받으며 다듬습니다. 긴 궤적에서는 자기 테스트와 검증이 더 보인다고 했어요.

4.5보다 시각·인터랙티브 작업의 첫 패스가 낫다는 게, 48시간 데모와 연결되는 지점입니다.

가격도 소넷 5와 겹쳐요. 입력 100만 토큰당 2달러, 출력은 6달러입니다. 빠른 변형은 두 배죠. 에이전트 기본 단가가 2달러대로 수렴합니다.

벤치마크 숫자는 어떤가요?

공식 표에서 그록 4.6 High의 AA Intelligence Index는 61이에요. GPT-5.6 Sol Max와 같고, 페이블 5 Max 62에 가깝습니다. 4.5 High는 56이었죠.

다른 벤치도 같은 방향이에요. GDPVal-AA v2는 1753으로, 4.5의 1526보다 올랐고 페이블 5 Max 1741을 살짝 넘습니다. CursorBench v3.2는 69.9%로 4.5의 66.7%보다 높고, 페이블 5 Max 70.5%에는 못 미쳐요.

약한 축도 표에 있어요. DeepSWE v1.1은 65.9%로 4.5의 54%보다는 올랐지만, GPT-5.6 Sol Max 73%, 페이블 5 Max 70%보다 낮습니다. Terminal-Bench v3.0은 26%죠. 4.5의 15.7%보다는 낫고, GPT-5.6 34.6%와 페이블 5 34.1%에는 못 미칩니다.

이 표가 중요한 이유는 "전부 1등"이 아니기 때문이에요. 종합 지수와 지식 업무·시각 빌드 쪽은 앞줄에 있고, 터미널 벤치와 일부 SWE 축은 아직 뒤입니다.

패트릭 콜리슨이 터미널 하네스를 비판한 맥락과 겹쳐 읽히기도 합니다. 그록이 자랑하는 작업과, 터미널 벤치가 재는 작업이 같은 기술이 아닐 수 있어요.

나머지 표도 같은 패턴이에요. FrontierCode v1.1 Extended 61.3%, APEX-Agents 57.5%, APEX-SWE 56.4%. 모두 4.5에서 큰 폭으로 올랐고, GPT-5.6·페이블 5 Max와 비슷한 구간에 있습니다.

AA-Briefcase 1577은 페이블 5 Max 1574와 거의 같고, Harvey LAB 15.8%만 경쟁 모델보다 높게 나왔어요. 한 줄로 이기지 않고, 에이전트·지식 업무 묶음에서 4.5를 밀어 올린 표죠.

학습 데이터는 무엇을 말하나요?

학습 이야기도 데모보다 남길 만해요. 4.5로 SFT 궤적을 다시 만들고, 에이전트 하네스 궤적에서 문제 트레이스를 걸렀습니다. 그다음 에이전트 RL을 커널, 웹, CAD 환경까지 넓혔죠.

"예쁜 첫 화면"이 나온 이유는 마케팅 문장 이전에, 학습 데이터가 그 작업을 포함하기 때문이에요.

같은 주 OpenAI 빌더 가이드는 반대편 회사의 같은 숙제입니다. GPT-5.6도 더 긴 작업을 더 싼 가격-성능으로, 하네스를 크게 안 바꾸고 돌리게 만들겠다고 적었어요. 모델 경쟁이 채팅 점수가 아니라 에이전트 지속 시간으로 옮겨가는 중이죠.

한계와 반론은 무엇인가요?

48시간 빌더 반응은 소스로는 약합니다. 데모는 선택 편향이 크고, 실패작은 안 올라옵니다. 공식문이 말하는 자기 검증이 실제 제품에서 얼마나 자주 나오는지도 외부 재현이 없습니다.

벤치 숫자는 회사 표예요. 경쟁 모델 점수는 "self-reported 또는 공개 결과 중 최고"라고 주석이 달려 있습니다. 같은 조건의 독립 평가로 읽으면 안 돼요.

안전 문단은 짧죠. 가드레일을 능력에 맞춰 조정했고, 취약점 패치와 엔지니어링 설계, AI 연구 지원 같은 합법 용도를 열겠다고 했습니다. 사전·사후·제3자 테스트를 넓혔다는 주장 외에, 생물학처럼 폴백 수치를 구체로 내놓지는 않았어요.

가격의 빠른 변형이 두 배라는 점도 함정이 될 수 있습니다. 기본 2/6을 보고 예산을 잡으면, 지연이 싫어 패스트로 바꾸는 순간 단가가 달라져요.

어떤 기준으로 판단하면 되나요?

그록 4.6을 "코딩 1등"으로 사지 마세요. 공식문이 미는 구간은 긴 에이전트 궤적과, 아이디어를 동작하는 시각 결과물로 만드는 1차 패스예요.

비교할 때는 세 줄을 같이 보세요. AA 지수 61, CursorBench 69.9%, Terminal-Bench 26%. 앞의 두 줄만 보면 프론티어고, 세 번째 줄을 보면 터미널 작업은 아직 다른 모델 뒤에 있습니다.

소넷 5와 같이 쓸 가능성도 있어요. 실행 단가는 둘 다 입력 2달러대입니다. 소넷 5는 에이전트 실행 층과 캐시 구조가 문서화돼 있고, 그록 4.6은 시각 1차 패스와 긴 루프를 전면에 내세우죠.

한 모델로 모든 루프를 덮겠다는 가정보다, 작업 종류를 나누는 편이 표와 맞습니다.

남는 생각

저는 이번 표를 "데모 경연"이 아니라 경쟁 축이 옮겨가는 신호로 읽습니다.

데모 열기는 하루면 충분해요. 남길 건 데모가 아니라, 어떤 벤치에서 앞이고 어떤 벤치에서 뒤인지입니다.


원문·소스

FAQ

자주 묻는 질문

그록 4.6에서 무엇이 바뀌었나요?
4.5 위에 올린 모델로, 초점은 복잡한 일을 여러 단계에 걸쳐 붙잡고 있는 오래 가는 에이전트입니다. 4.5보다 긴 보충 학습을 돌렸고, Cursor와 Grok Build에서 당일 열리며 첫 주 포함 사용량을 2배로 줬습니다.
왜 오래 가는 에이전트가 초점인가요?
프론티어 경쟁이 한 방 답에서 오래 가는 작업으로 옮겨가고 있어서예요. 오픈AI의 GPT-5.6 빌더 가이드도 더 긴 작업을 더 적은 토큰으로 되게 만들겠다는 같은 말을 합니다. 가격도 입력 100만 토큰당 2달러, 출력 6달러로 소넷 5와 겹칩니다.
벤치마크 숫자는 어떤가요?
AA Intelligence Index 61로 GPT-5.6 Sol Max와 같고 페이블 5 Max 62에 가깝습니다. GDPVal-AA v2 1753, CursorBench v3.2 69.9%로 4.5보다 올랐지만, Terminal-Bench v3.0은 26%로 GPT-5.6 34.6%와 페이블 5 34.1%에 못 미칩니다.
학습 데이터는 무엇을 말하나요?
그록 4.5로 SFT 궤적을 다시 만들고 에이전트 하네스 궤적에서 문제 트레이스를 걸렀습니다. 에이전트 RL은 일반 코딩만이 아니라 커널 최적화, 웹 개발, CAD 환경까지 넓혔어요. 데모가 게임과 웹사이트 쪽으로 쏟아진 이유가 랜덤이 아닐 수 있습니다.
한계와 반론은 무엇인가요?
벤치 숫자는 회사 표이고, 경쟁 모델 점수는 self-reported 또는 공개 결과 중 최고라는 주석이 달려 있습니다. 48시간 빌더 반응은 선택 편향이 크고, 빠른 변형이 기본 가격의 두 배라는 점도 함정이 될 수 있어요.
어떤 기준으로 판단하면 되나요?
AA 지수 61, CursorBench 69.9%, Terminal-Bench 26% 세 줄을 같이 보면 됩니다. 앞의 두 줄만 보면 프론티어고, 세 번째 줄을 보면 터미널 작업은 아직 다른 모델 뒤에 있습니다.