원본 기사

https://www.youtube.com/post/UgkxNbIzek5TyFqG_C60F7-zQLMIsX7l_NnC

주요 포인트 3줄 정리

  • xAI가 코딩과 에이전트 작업에 초점을 둔 Grok 4.6을 공개하며, 긴 작업을 끝까지 수행하고 결과를 스스로 점검하는 능력을 강화했다고 소개했습니다.
  • Artificial Analysis의 Intelligence Index에서 61점을 기록해 GPT-5.6 Sol Max와 동률에 올랐고, 직전 Grok 4.5의 56점에서 5주 만에 5점 상승했습니다.
  • 코딩·에이전트 벤치마크도 크게 뛰어 DeepSWE는 54%→65.9%, Terminal-Bench는 15.7%→26%로 올랐으며, AA-Briefcase에서는 GPT-5.6 Sol과 Claude Fable 5를 앞섰습니다.

핵심 키워드

  • Grok 4.6
  • GPT-5.6 Sol
  • 에이전트 벤치마크

내 생각 정리

이번 글의 핵심은 단순한 모델 출시 소식보다, 코딩과 에이전트 자동화의 실전 성능에서 xAI가 빠르게 격차를 좁히고 있다는 점에 있다. 특히 Terminal-Bench와 AA-Briefcase 같은 장기 작업 지표의 상승은, 앞으로의 경쟁 포인트가 ‘누가 더 똑똑한가’보다 ‘누가 더 끝까지 일을 수행하는가’로 이동할 가능성을 시사한다.

다만 성능 향상이 곧바로 사용자 경험 개선으로 이어지는 것은 아니다. 그록은 여전히 제약과 답변 거부가 많은 편이므로, 무해한 질문까지 과하게 차단하지 않으면서 악의적 질의만 정교하게 식별하는 필터 설계가 함께 고도화될 필요가 있다. 실사용 만족도는 모델 성능 자체보다도 이러한 안전장치의 정밀도에 더 크게 좌우될 수 있다.

본문 발췌

SpaceXAI가 코딩과 에이전트 작업에 초점을 맞춘 새 모델 Grok 4.6을 공개했습니다. 여러 단계를 거치는 긴 작업을 끝까지 수행하는 능력과 스스로 결과를 점검하는 능력을 강화했다고 합니다. DeepSWE는 54%에서 65.9%, Terminal-Bench는 15.7%에서 26%로 올랐고, AA-Briefcase에서는 GPT-5.6 Sol과 Claude Fable 5를 앞섰습니다.