안녕하세요, 주식회사 TIMEWELL의 하마모토 류타입니다.
8월 11일에 Grok Bot, 12일에 Grok 4.6. SpaceXAI가 며칠 사이에 에이전트 제품과 새 모델을 연달아 내놓았습니다. Grok Build도 바로 직전에 정식판이 나왔습니다.
벤치마크 읽기에는 주의가 필요합니다. 벤더가 공개한 비교표를 정직하게 세어 보면, 화제만큼 압승은 아닙니다. 그래도 「본격적으로 나왔다」는 평가에는 동의하고, 이유는 표의 다른 곳과 가격에 있습니다.
입장을 먼저 씁니다. 저희는 지금 Grok을 밉니다. 실무의 메인은 Grok Build이고, Codex도 같이 씁니다. 이유는 뒤의 가격 절에 쓰지만, 가성비로 보면 Grok의 우위가 분명해지고 있다는 것이 현재의 평가입니다.
이 사흘 동안 무엇이 나왔는가
사실을 늘어놓습니다.
Grok 4.6은 2026년 8월 12일 공개입니다1. 전 세대 Grok 4.5는 7월 8일 공개였으니, 약 한 달 만의 갱신입니다.
Grok Bot은 8월 11일에 베타 공개되었습니다2. 자리매김이 꽤 강합니다. 상시 가동되는 AI 에이전트 팀이 전용 클라우드 환경을 갖고, 고객의 기존 도구에 로그인해, 다단계 작업을 감독 없이 끝낸다는 것입니다. Mac, iOS로 시작해 Windows, Linux 데스크톱 판도 나와 있습니다. SuperGrok Heavy 같은 기존 상위 플랜에 포함되는 형태입니다2.
Grok Build는 코딩 에이전트입니다. 프로젝트 폴더 안에서 커맨드라인 도구로 동작하고, 코드베이스를 향해 자연어로 지시합니다. 「이 저장소의 구성을 설명해 줘」「이 API에 레이트 리밋을 추가해 줘」 같은 쓰임을 염두에 두고 있습니다2. 7월 28일 얼리 베타, 8월 7일 v1.0.0이 나왔습니다3.
회사 자체도 바뀌었습니다. 2026년 2월 2일 SpaceX가 xAI를 전부 주식 교환으로 인수했고, 5월에 xAI는 독립 회사로서 해산, 7월 6일에 SpaceXAI라는 새 사명과 로고가 공개되었습니다4. 6월에는 IPO도 마쳤습니다. 지금의 Grok은 로켓 회사, SNS와 같은 지붕 아래에 있습니다.
벤치마크를 정직하게 읽기
보내 주신 표를 승패로 셉니다.
| 벤치마크 | Grok 4.6 High | Grok 4.5 High | GPT-5.6 Sol Max | Fable 5 Max |
|---|---|---|---|---|
| AA Intelligence Index | 61 | 56 | 61 | 62 |
| GDPVal-AA v2 | 1753 | 1526 | 1728 | 1741 |
| CursorBench v3.2 | 69.9% | 66.7% | 67.2% | 70.5% |
| DeepSWE v1.1 | 65.9% | 54% | 73% | 70% |
| FrontierCode v1.1 | 61.3% | 56.6% | 60.6% | 64.9% |
| APEX-Agents | 57.5% | 47.1% | 56.7% | 59.2% |
| Terminal-Bench v3.0 | 26% | 15.7% | 34.6% | 34.1% |
| APEX-SWE | 56.4% | 53.6% | 기재 없음 | 58.8% |
| AA-Briefcase | 1577 | 1313 | 1502 | 1574 |
| Harvey LAB (Vals) | 15.8% | 12.9% | 2.5% | 11.3% |
10개 항목 중 Grok 4.6이 최고값인 것은 3개입니다. Fable 5 Max가 5개, GPT-5.6 Sol Max가 2개. 게다가 이것은 SpaceXAI 자신이 공개한 비교표이고, 각주에는 「제3자 모델의 점수는 자기 신고값 또는 공개값 중 더 나은 것」이라고 적혀 있습니다5. 벤더가 자기에게 유리한 조건으로 만들 수 있는 표에서, 이 결과입니다.
그래서 「압승」이라는 읽기는 하지 않습니다.
그래도 진짜 볼거리는 다른 데 있습니다. 전 세대에서의 상승입니다.
AA Intelligence Index가 56에서 61. GDPVal-AA v2가 1526에서 1753. DeepSWE v1.1은 54%에서 65.9%. APEX-Agents는 47.1%에서 57.5%. AA-Briefcase는 1313에서 1577. Terminal-Bench는 15.7%에서 26%입니다.
한 달에 이만큼 움직였습니다. 절댓값이 1위였는지보다, 이 기울기가 더 무섭습니다. 다음이 같은 폭으로 오르면 순위가 바뀝니다.
그리고 벤더 표에 대한 의심은 제3자 지표로 확인할 수 있습니다. Artificial Analysis Intelligence Index v4.1.1은 GDPval-AA v2, τ³-Banking, Terminal-Bench v2.1, SciCode, Humanity's Last Exam, GPQA Diamond, CritPt, AA-Omniscience, AA-LCR의 9개 평가를 합성한 지표입니다6.
상위는 이렇게 되어 있습니다. Claude Opus 5(max)가 63, Claude Fable 5(폴백 포함)가 62, GPT-5.6 Sol(max)가 61, 그리고 Grok 4.6(high)가 61. 이어서 Kimi K3(max)가 60, Qwen3.8 Max가 58, GPT-5.6 Terra(max)와 Muse Spark 1.2가 57, Grok 4.5(high)가 56, Claude Sonnet 5(max)가 556.
즉 제3자 합성 지표에서도 Grok 4.6은 GPT-5.6 Sol과 동점 61이고, 선두 Claude Opus 5와는 2포인트 차입니다. 전 세대 56에서 5포인트 올려 상위 집단에 들어갔습니다. 벤더 표의 주장은, 여기서는 대체로 뒷받침됩니다.
키우지 않고 올린다는 선택
기술적으로 가장 재미있는 것은 여기입니다.
Grok 4.6은 파라미터 수 1.5조로, Grok 4.5와 같은 V9 기반 그대로입니다. 개선은 사후학습, 즉 지도 파인튜닝과 강화학습에 모아져 있습니다1. 모델을 키워서 때린 것이 아닙니다.
이것은 업계 전체에 시사적이라고 봅니다. 기반을 그대로 두고 사후학습만으로 전 세대를 크게 넘어선 실례이기 때문입니다. 스케일 법칙으로 밀어붙이던 시대에서, 같은 토대를 어떻게 마감하느냐의 승부로 옮아가고 있다는 읽기의 근거가 됩니다.
다만 약점도 분명히 나옵니다. **Terminal-Bench v3.0이 26%**로, GPT-5.6의 34.6%, Fable 5의 34.1%에 비해 명확히 낮습니다. 터미널 위에서 긴 절차를 해내는 능력을 재는 벤치마크이고, 여기가 약합니다.
바로 그 능력을 파는 제품인 Grok Build와 Grok Bot을 같은 주에 내놓고 있습니다. 제품 발표와 실측값 사이에 이 차이가 있다는 것은, 도입을 검토하는 쪽이 알아 두는 편이 좋다고 생각합니다. 에이전트 제품은 데모와 실운용의 낙차가 가장 큰 영역입니다.
머스크가 사내에서 한 말
제품 뒤에 있는 의지의 이야기입니다.
SpaceX 전사 회의에서 머스크는 직원에게 이렇게 말했습니다. 약 29분의 영상이 SpaceX의 X 계정에 올라갔습니다7.
우리는 AI에서 이겨야 한다. 미래는 압도적으로 AI와 로봇이기 때문이다7
숫자도 꽤 구체적입니다. SpaceX의 AI 수익이 다른 모든 사업 라인을 「아마 9월에」 넘어서고, 4분기에 더 벌린다. AI 계산 자원을 2027년 말까지 10기가와트로 하고 싶다. 그리고 이렇게 이어집니다.
내년 말까지 10GW의 AI를 온라인으로 올릴 수 있다면, 연간 3,000억에서 5,000억 달러의 수익이 된다7
게다가 「아마 4~5년 안에 AI가 SpaceX 가치의 99%가 될 것이다」라고도 말했습니다7. 로켓 회사의 경영자가, 자사 가치의 99%는 로켓이 아니게 된다고 사내에서 말하는 것입니다.
그리고 이 수익은 Starship과 화성 계획의 재원이 되고, 그 흐름은 Tesla, SpaceX, xAI의 공동 칩 공장 Terafab을 통과한다는 구도입니다7. Terafab은 공개값과 보도의 어긋남까지 포함해 SpaceX와 Tesla의 Terafab에서 정리했습니다.
읽을 때 조심할 것은, 이것은 목표이지 실적이 아니다라는 점입니다. 10GW도, 3,000억 달러도, 99%도 아직 달성되지 않았습니다. 사내를 향한 독려라는 성격도 당연히 있습니다. 다만 이 규모의 목표를 건 조직이 실제로 한 달 만에 모델을 갱신하고, 같은 주에 에이전트 제품을 두 개 내놓았다는 사실 쪽을 저는 무겁게 봅니다. 말이 아니라 출하 속도가 의지를 보여 줍니다.
가격을 어떻게 볼 것인가. 그리고 중국 진영과의 차이
여기가 이번에서 가장 큰 변화입니다. 성능 이야기보다, 가격이 경쟁상의 한 수로서 더 무겁다고 생각합니다.
Grok 4.6의 API 가격은 100만 토큰당 입력 2달러, 출력 6달러. Grok 4.5에서 동결입니다8. xAI 자신이 이것을 「다른 프런티어 모델의 반액」으로 자리매김하고 있습니다8.
성능을 한 세대 올리고 가격을 그대로 두었습니다. 실질적인 인하입니다. 게다가 이 수는, 토큰량에 비례해 비용이 늘어나는 개발자와 에이전트 구축자에게 곧장 먹힙니다.
제3자 지표와 가격을 나란히 두면 위치가 분명해집니다.
| 모델 | AA Index | 입력(100만 토큰) | 출력(100만 토큰) |
|---|---|---|---|
| Grok 4.6 | 61 | 2.00달러 | 6.00달러 |
| Kimi K3(max) | 60 | 3.00달러 | 15.00달러 |
| Qwen3.8 Max | 58 | 공개 정보를 확인하지 못함 | 공개 정보를 확인하지 못함 |
| Grok 4.5 | 56 | 2.00달러 | 6.00달러 |
| DeepSeek V4 Flash | 52 | 0.14달러 | 0.28달러 |
Kimi K3와 비교하면 Grok 4.6은 점수에서 1포인트 위, 출력 가격은 2분의 1 이하입니다9. 여기를 주목할 만합니다. 중국 진영은 「싸게 때린다」로 이해되기 쉽지만, 상위 대역까지 올라온 Kimi K3는 결코 싸지 않습니다. 같은 점수 대역에서 가장 싼 것이 Grok이 되었습니다.
한편 DeepSeek V4 Flash는 입력 0.14달러, 출력 0.28달러9. 자릿수가 두 개 다릅니다. 다만 AA Index는 52로 Grok 4.6과 9포인트 차. 여기는 같은 마당이 아닙니다. 용도를 좁혀 싸게 돌리려면 DeepSeek, 프런티어급 능력이 필요하면 Grok, 이라는 역할 나눔입니다.
덧붙이면 중국 진영의 진짜 차별화 축은 가격 자체보다 오픈 웨이트에 있습니다. SWE-bench Verified에서 80.2%부터 80.6%의 0.4포인트 대역에 5개 모델이 늘어서고, 그중 DeepSeek V4 Pro Max는 가중치를 공개합니다9. 자체 환경에서 돌릴 수 있다는 데 가치를 둔다면, 이 선택지는 여전히 강합니다.
다만 조건도 적습니다. 프롬프트가 20만 토큰 이상이 되면 입력 4달러, 출력 12달러로 배가됩니다. 웹 검색, X 검색, 코드 실행은 각각 1,000회당 5달러의 별도 과금입니다8. 오래 돌아가는 에이전트는 바로 이 배가 구간과 검색 과금에 들어갑니다. 카탈로그 가격만으로 견적하면 빗나갑니다.
그럼에도 우리가 Grok을 미는 이유
입장을 분명히 씁니다. 현재의 가성비는 Grok이 한 몸 앞서 나가고 있다고 봅니다.
근거는 세 가지입니다.
첫째. 같은 점수 대역에서 가장 싸다는 것. AA Index 61을 받으면서 입력 2달러, 출력 6달러는 상위 집단 안에서 분명히 유리한 위치입니다. 1점 위의 Fable 5, 2점 위의 Claude Opus 5와 견줄 때, 일상 업무로 돌리는 양을 생각하면 차이가 먹힙니다.
둘째. 값을 올리지 않고 세대를 올렸다는 것. 한 번의 반값이 아니라, 가격을 경쟁 축으로 유지하겠다는 의사 표시로 읽습니다. 머스크의 사내 발언과 맞추면, 수익의 가져가는 법을 모델 단가가 아니라 규모에 두고 있음이 보입니다.
셋째. 실제로 쓰고 있기 때문입니다. 저희는 Grok Build를 실무의 메인으로 씁니다. Codex도 같이 씁니다. 카탈로그 비교가 아니라, 매일의 작업으로 돌려 본 체감으로, 가격당 일의 양이 좋습니다.
체감을 구체적으로 씁니다. Grok Build의 사용감은 Fable 5와 손색이 없습니다. 코드를 읽혀 고치게 하는 일련의 작업에서, 명확히 뒤떨어진다고 느끼는 장면이 적습니다. 그 위에서 가격이 절반이면, 고르는 이유가 됩니다. 멀티모달로 다룰 수 있다는 것도 실무에서는 생각보다 먹힙니다. 화면 스크린샷, 도면, 손글씨 메모. 텍스트로 옮긴 뒤에 넘기는 수고가 사라집니다. 수수하지만 매일 먹히는 차이입니다.
다만 일본어 생성 능력에는 아직 위화감이 남습니다. 말투가 부자연스러워지거나, 경어체와 평어체가 섞이는 장면이 있습니다. 여기는 Claude가 더 안정적입니다. 일본어로 최종 산출물을 내는 업무에서는 아직 손이 필요합니다. 빨리 따라잡아 주었으면, 하는 것이 솔직한 바람입니다.
넷째. 이미지, 음성, 영상을 같은 자리에서 만들 수 있다는 것. 여기는 의외로 잘 이야기되지 않지만, 실무에서는 큰 차이입니다.
Grok은 Grok Imagine으로 이미지와 영상 생성을 갖고 있습니다. 이미지는 1장 0.02달러, 품질 중시 모드에서 1K가 0.05달러, 2K가 0.07달러10. 8월 7일에는 Grok Imagine Image 2.0이 나와, 지시에 대한 추종과 편집이 개선되었습니다3.
영상도 강화되었습니다. Grok Imagine Video 1.5는 텍스트에서 영상, 이미지에서 영상, 참조 이미지에서 영상에 대응하고, 텍스트와 이미지에서의 생성은 네이티브 1080p입니다. 1초부터 15초의 클립을 생성하며, API 가격은 480p에서 초당 0.05달러, 720p에서 0.07달러10.
그리고 음성입니다. 7월 29일에 Grok Voice Think Fast 2.0이라는 음성 대 음성 모델이 나와, 8월 5일에 기본값이 되었습니다. 가격은 음성 1분당 0.08달러3.
제가 주목하는 것은, 영상 생성에 음성이 같은 패스로 탄다는 점입니다. 음악, 효과음, 대사를 별도 공정의 음성 처리가 아니라 같은 생성 안에서 만듭니다. 초당 0.08달러라는 설정입니다10. 영상을 만든 뒤에 소리를 입히는 절차가 필요 없습니다.
이것은 Claude에는 없는 영역입니다. Claude는 이미지도 음성도 영상도 생성하지 않습니다. 텍스트와 코드에서는 매우 강하지만, 산출물이 텍스트 밖으로 나가는 업무에서는 애초에 마당에 오르지 않습니다. 저희 용도로 말하면 자료의 도판, 설명 영상, 음성 가이드 같은 작업이 여기에 해당합니다.
이 차이는 모델의 똑똑함 비교와는 다른 축입니다. 벤치마크 점수에는 나오지 않습니다. 다만 사내에서 쓰는 도구를 줄이려 할 때, 「이것 하나로 이미지도 영상도 음성도 낼 수 있다」는 조건은 계약과 운용의 본 수를 그대로 줄입니다. 명확한 어드밴티지라고 봅니다.
공평을 위해 약점도 반복합니다. Terminal-Bench는 26%로 명확히 낮습니다. 긴 절차를 자율적으로 해내는 장면에서는 아직 다른 모델 쪽이 안정적입니다. 저희가 여러 개를 병용하는 것은, 거기와 일본어를 메우기 위해서입니다. 하나로 몰지 않고, 가격이 먹히는 영역에 Grok을 두껍게 둔다는 것이 현재로서의 실무적 답이라고 생각합니다.
그리고 몇 주 뒤에는 Grok 4.7이 대기하고 있습니다. 2.1조 파라미터로, 이번에는 기반 자체가 커질 예정입니다1. 이번이 「키우지 않고 사후학습으로 5포인트」였음을 생각하면, 다음은 기대해도 좋다고 봅니다. 일본어가 거기서 개선되면, 저희의 역할 나눔은 한 단 단순해집니다.
참고로 중국 진영에서는 Kimi K3를 높이 평가합니다. AA Index 60은 상위 집단 그 자체이고, 「싸니까 쓴다」는 단계는 이미 지났습니다. 가격은 출력 15달러로 Grok보다 비싸서 저희의 주력으로는 두지 않지만, 실력은 진짜입니다. 중국 진영을 가격대로만 묶는 보기는 이제 실태에 맞지 않습니다.
그리고 SpaceXAI가 가격 외에 노리는 자리도 보입니다. 에이전트의 완성도와 통합입니다. Grok Bot이 「전용 클라우드 환경을 갖고, 기존 도구에 로그인해 감독 없이 움직인다」는 설계인 것은, 모델 단품이 아니라 움직이는 환경까지 묶어 판다는 선택입니다. 오픈 웨이트를 자체로 돌리는 쪽이 가장 번거롭게 느끼는 부분을, 그대로 제품으로 만들었습니다.
다만, 도쿄 리전에서는 쓸 수 없습니다
미는 입장에서 쓰지만, 일본 기업에게 가장 큰 우려는 여기입니다. 가격도 성능도 아닙니다.
Grok은 도쿄 리전을 지정해 쓸 수 없습니다.
Amazon Bedrock에는 2026년 6월에 Grok이 올랐습니다. 다만 올라간 것은 Grok 4.3이고, 이번 4.6이 아닙니다11. 그리고 그 4.3의 리전 내 추론에 대응하는 것은 **미국 서부(오리건), 미국 동부(버지니아 북부), 미국 동부(오하이오)**입니다. 7월에는 AWS GovCloud(US-West)에도 배포되었지만, 이것도 미국입니다11.
아시아 태평양(도쿄)은 들어 있지 않습니다.
데이터 보존에도 조건이 있습니다. AWS의 설명에 따르면 store=false를 지정하는 것만으로는 보존 제로를 보증하지 않습니다. 확실히 제로로 하려면, 실효적인 데이터 보존 모드가 none이고, 그 모드를 허용하는 모델이어야 합니다11.
일본에서 일을 하면, 이 한 점이 먹힙니다.
이유는 감정이 아니라 절차입니다. 개인정보의 국외 이전은 본인 동의나, 이전처 체제에 대한 정보 제공이 필요합니다. 업종에 따라서는 감독 관청의 가이드라인에서 소재가 물어집니다. 그리고 가장 현실적인 것은 고객과의 계약과 사내 규정입니다. 「데이터는 국내에 남을 것」이라고 적혀 있는 계약은 드물지 않습니다. 기술적으로 아무리 뛰어나도, 이 한 줄이 있으면 쓸 수 없습니다.
즉 일본 기업의 실무에서는 모델 선정에 「도쿄 리전에서 돌아가는가」라는 열이 하나 늘어납니다. 그리고 이 열은 벤치마크 점수나 가격보다 먼저 먹힙니다. 해당하지 않으면, 다른 열을 보기 전에 떨어집니다.
저희가 용도를 나누는 것은 이 사정도 있습니다. 리전 제약이 먹히지 않는 영역에서는 Grok을 두껍게 쓰고, 데이터의 소재가 먹히는 영역에서는 국내에서 돌아가는 구성을 쓴다. ZEROCK을 국내 AWS 서버에서 운용하는 것은, 이 후자의 요구에 응하기 위해서입니다.
이 이야기는 Grok만의 문제가 아닙니다. AI 모델의 공급이 미중에 집중되어 있는 것 자체가, 일본에게는 구조적인 의존입니다. 같은 형태의 문제를 측위, 에너지, 식량까지 넓혀 정리한 것이 준천정위성 7호기와 일본의 의존 구조에 있습니다. 사내 데이터를 어디에 맡길지의 논점은 LLM 벤더에 데이터를 직접 넘기는 것이 부르는 위기에 정리했습니다.
한편, ZDR의 설계는 평가합니다
리전 이야기와는 별개로, 데이터 보존 자체의 설계는 평가할 수 있습니다. 여기는 공평하게 씁니다.
xAI의 기본값에서는 API의 요청과 응답이 감사 목적으로 30일간 서버에 저장됩니다(저장 시 암호화). 다만 이 데이터로 학습은 하지 않고, 30일 후 자동 삭제됩니다12.
그리고 **ZDR(Zero Data Retention, 제로 데이터 리텐션)**을 켜면, API의 입력(프롬프트)과 출력(생성 토큰)이 디스크에 영속화되지 않습니다12. 저희가 확인한 범위에서는, 이것은 상위 플랜 구매가 아니라 설정으로 켤 수 있고, 추가 요금은 발생하지 않습니다. 여기는 솔직히 좋다고 생각합니다.
요금 체계 안에 「데이터를 지키려면 상위 계약으로」라는 단차를 만들지 않았다는 것입니다. 컴플라이언스 요건을, 낼 수 있는 회사만의 특전으로 두지 않았습니다. 사소한 이야기로 보이지만, 사내 결재의 통과 용이성에 직결됩니다.
주의점도 두 가지입니다. 하나는 ZDR이 팀 단위라는 것으로, API 키마다 개별적으로 켤 수는 없습니다12. 또 하나는, Grok Build도 API 키를 통한 이용은 ZDR을 따르지만, ZDR을 끄고 있는 경우에는 CLI의 /privacy 명령으로 데이터 보존을 멈춰야 한다는 설계입니다12. 기본값으로 전부 멈추는 것이 아니므로, 도입 때 한 번 만져 둘 필요가 있습니다.
다만 여기를 두 손으로 칭찬할 이야기는 아닙니다. 2026년 7월, Grok Build가 코드베이스 전체를 xAI 스토리지로 업로드하고 있었다는 것이 보도되었고, 당시의 프라이버시 설정이 기대대로 기능하지 않았다는 지적이 나왔습니다. SpaceXAI 측은 Grok Build가 출시 이후 ZDR을 완전히 존중해 왔으며, CLI에서 업로드를 끄는 것은 항상 가능했고 그 선택은 존중되어 왔다고 설명합니다13. 사실 관계에는 어긋남이 남아 있습니다. 본 기사는 어느 쪽이 정확한지를 판정하지 않습니다.
다만 실무의 교훈은 명확합니다. 정책이 좋은 것과, 구현이 그대로 움직이는 것은 별개입니다. 저희가 Grok Build를 주력으로 하는 것은 사실이지만, 다루는 데이터의 성질에 따라 나누어 쓰고 있습니다. 여기는 자체로 거동을 확인한 위에서 판단해야 할 부분입니다. 같은 구조의 이야기는 테넌트 분리는 왜 「나중에」 무너지는가에 썼습니다.
솔직히 말하면, 도쿄 리전이 해소되면 저희의 역할 나눔은 훨씬 단순해집니다. ZDR이라는 토대는 되어 있으니, 나머지는 소재뿐입니다. Grok 4.7에서 모델이 좋아지는 것보다, 저는 이쪽을 기다리고 있습니다.
오픈 웨이트를 자체 환경에서 돌리는 선택지 자체는, 일본 기업에게 현실적인 검토 대상입니다. 멀티테넌트 SaaS에 데이터를 맡길 때의 논점은 테넌트 분리는 왜 「나중에」 무너지는가에 정리했습니다.
일본 기업은 어떻게 마주할 것인가
정리합니다.
2026년 8월 11일에 Grok Bot, 12일에 Grok 4.6. 회사는 2월에 SpaceX로 흡수되고, 7월에 SpaceXAI로 개칭. 머스크는 사내에서 「AI에서 이겨야 한다」고 말했고, 2027년 말까지 AI 계산 자원 10GW, AI가 SpaceX 가치의 99%가 된다는 전망을 제시했습니다.
벤더 공개표에서는 10개 항목 중 3개가 최고값. 다만 제3자의 Artificial Analysis Intelligence Index에서도 61로 GPT-5.6 Sol과 동점, 선두 Claude Opus 5와는 2포인트 차까지 왔습니다. 게다가 모델을 키우지 않고 사후학습으로 5포인트 올렸습니다. 약점은 Terminal-Bench와 일본어 생성이고, 전자는 신제품의 주전장과 겹칩니다.
그리고 가격은 동결의 입력 2달러, 출력 6달러. 같은 점수 대역에서 가장 싸고, 1포인트 아래의 Kimi K3(입력 3달러, 출력 15달러)보다 출력은 2분의 1 이하입니다. 성능을 올리고 가격을 동결한 실질 인하가, 이번에서 가장 무거운 한 수라고 봅니다.
실무로서 어떻게 할 것인가. 모델을 하나로 못 박지 않는다, 가 현재의 답이라고 생각합니다. 한 달에 이만큼 순위가 움직이는 시장에서, 특정 모델 전제의 만들기를 하면 다음 갱신에서 다시 만들게 됩니다. 프롬프트도 평가도, 모델을 갈아 끼울 수 있는 형태로 갖고 있으십시오.
그 위에서, 자사 업무에서 무엇을 잴지를 먼저 정해 두는 것입니다. 이번 표에서도 GDPVal, Briefcase, 법무 계열에서 강한 모델과 터미널 작업에서 강한 모델은 달랐습니다. 벤치마크의 종합점은 자사 용도와 거의 관계가 없습니다. 자사의 실제 과제를 20개라도 잘라 내, 후보 모델에 같은 문제를 풀게 하십시오. 그것이 유일하게 제대로 된 비교가 됩니다.
솔직히, 이 분야는 쫓는 것만으로 소모됩니다. 한 달에 세대가 바뀌고, 몇 주 뒤에는 Grok 4.7이 2.1조 파라미터로 나온다고 예고되어 있습니다1. 전부를 계속 평가하는 것은 무리입니다. 그래서 쫓는 대상을 「모델」이 아니라 「자사의 재는 법」에 두는 편이 지속됩니다.
그 위에서 저희의 현재지를 한 번 더 쓰면, 주력은 Grok Build, 일본어 최종 산출물과 긴 자율 작업은 다른 모델로 메운다는 형태입니다. Grok 4.7에서 일본어가 개선되면 이 역할 나눔은 필요 없어질지도 모릅니다. 거기는 기대해서 기다립니다.
그리고 잊기 쉬운 것이, 선정의 축은 벤치마크 점수만이 아니다라는 점입니다. 이미지, 음성, 영상을 같은 자리에서 만들 수 있는지는 점수표 어디에도 나오지 않지만, 계약과 운용의 본 수를 정합니다. 자사가 무엇을 만드는 회사인지에 따라, 봐야 할 열이 바뀝니다.
나아가 일본 기업에는 점수보다 먼저 먹히는 열이 있습니다. 도쿄 리전에서 돌아가는지입니다. Grok은 현재 여기에 해당하지 않습니다. 계약서에 「데이터는 국내에 남는다」고 적혀 있는 안건에서는 성능도 가격도 검토 대상이 되지 않습니다. 이 열은 처음에 봐야 하고, 마지막에 보면 전부 다시 하게 됩니다.
AI 활용의 설계나, 어떤 모델을 어디에 쓸지의 정리에 대해 상담하고 싶은 분은 WARP의 생각이 참고가 될 수 있습니다. 구체적인 상황에 들어간 상담은 여기로 주십시오.
Footnotes
-
Grok 4.6은 2026년 8월 12일에 공개. 파라미터 수 1.5조로 Grok 4.5와 같은 V9 기반을 쓰며, 개선은 사후학습(지도 파인튜닝 및 강화학습)에 의한 것으로 스케일 확대에 의한 것이 아니라고 한다. 장시간 동작하는 에이전트 및 대화적, 시각적 작업에 중점이 두어져 있다. 더 큰 2.1조 파라미터의 Grok 4.7이 몇 주 뒤에 이어질 예정이라고 한다. 공식 발표는 https://x.ai/news/grok-4-6 (본 기사 집필 시점에 이쪽에서의 접근은 Cloudflare에 의해 차단되었으므로, 내용은 해당 발표를 인용하는 이차 정보로 확인했다) https://kie.ai/blog/what-is-grok-4-6 / https://www.buildfastwithai.com/blogs/grok-4-6-preview ↩ ↩2 ↩3 ↩4
-
Grok Bot은 2026년 8월 11일에 베타 공개. 상시 가동되는 AI 에이전트 팀이 전용 클라우드 환경을 갖고, 고객의 기존 도구에 로그인해 다단계 작업을 감독 없이 끝내는 것으로 여겨진다. Mac, iOS에 더해 Windows, Linux 데스크톱 판이 제공되며, Android는 추후. 기존 상위 구독(SuperGrok Heavy 등)에 포함된다. https://www.unite.ai/xai-launches-grok-bot-always-on-ai-teammates-with-their-own-cloud-computers/ / Grok Build는 코딩 에이전트로, 프로젝트 폴더 내 커맨드라인 도구로 동작하며 코드베이스에 대해 자연어로 지시를 준다. SuperGrok Heavy 가입자부터 얼리 베타로 제공되었다. https://www.eweek.com/news/xai-grok-build-coding-agent/ ↩ ↩2 ↩3
-
Grok Build의 릴리스 이력. 2026년 7월 28일에 Build Mode 얼리 베타, 2026년 8월 7일에 v1.0.0(대시보드 및 CLI 수정). https://releasebot.io/updates/xai ↩ ↩2 ↩3
-
2026년 2월 2일, SpaceX가 xAI를 전부 주식 교환으로 인수해 xAI는 SpaceX의 완전 자회사가 되었다(xAI 주식 1주당 SpaceX 주식 0.1433주). 2026년 5월에 xAI는 독립 회사로서 해산하고, AI 부문은 SpaceXAI로 개칭. 2026년 7월 6일에 새 사명과 로고가 X에서 공개되었다. 통합 후의 회사는 SpaceX, xAI, X를 포함한다. https://finance.yahoo.com/technology/ai/articles/xai-makes-rebrand-spacexai-complete-215010760.html / https://www.socialmediatoday.com/news/spacex-rebrands-as-spacexai/824656/ ↩
-
본 기사에서 참조한 벤치마크 비교표는 SpaceXAI가 공개한 것이다. 그 표의 각주에는 「Third-party model scores best of self-reported or publicly available.(제3자 모델의 점수는 자기 신고값 또는 공개값 중 더 나은 것)」이라고 기재되어 있다. 벤더 자신이 작성한 비교임을 전제로 읽을 필요가 있다. 본 기사에서는 이 점을 보완하기 위해 제3자 지표인 Artificial Analysis Intelligence Index를 함께 적었다. ↩
-
Artificial Analysis Intelligence Index v4.1.1. GDPval-AA v2, τ³-Banking, Terminal-Bench v2.1, SciCode, Humanity's Last Exam, GPQA Diamond, CritPt, AA-Omniscience, AA-LCR의 9개 평가를 합성한 지표. 게재되어 있는 주요 점수는 Claude Opus 5(max) 63, Claude Fable 5(폴백 포함) 62, GPT-5.6 Sol(max) 61, Grok 4.6(high) 61, Kimi K3(max) 60, Qwen3.8 Max 58, Muse Spark 1.2(xhigh) 57, GPT-5.6 Terra(max) 57, Grok 4.5(high) 56, Claude Sonnet 5(max) 55, GLM-5.2(max) 53, GPT-5.6 Luna(max) 52, DeepSeek V4 Flash 0731(max) 52, Gemini 3.6 Flash 52, MiniMax-M3 45, MiMo-V2.5-Pro 43, Inkling 42, Nemotron 3 Ultra 38, Gemini 3.5 Flash-Lite 37, Muse Glimmer(high) 35, Mistral Medium 3.5 30, Gemma 4 31B 30. https://artificialanalysis.ai/ ↩ ↩2
-
SpaceX 전사 회의에서의 일론 머스크 발언. 약 29분의 영상이 SpaceX의 X 계정에 게시되었다. 「we must win on AI, because the future is overwhelmingly AI and robots」, AI 수익이 다른 모든 사업 라인을 「아마 9월에」 넘어서고 4분기에 더 벌린다는 전망, 2027년 말까지 AI 계산 자원 10기가와트를 목표로 하는 것, 「if we bring 10GW of AI online by the end of next year, it will be $300 billion to $500 billion a year in revenue」, 「Probably in four or five years, AI will be 99% of the value of SpaceX」, 그리고 이 수익이 Starship과 화성 계획의 재원이 되며 Tesla, SpaceX, xAI의 공동 칩 공장 Terafab을 통과한다는 기술은 모두 해당 보도에 따른다. https://www.teslarati.com/spacexs-next-trillion-dollar-bet-has-nothing-to-do-with-rockets-musk-tells-staff/ / 본 기사 집필 시점에 이들은 목표 및 전망이며, 달성된 실적이 아니다. ↩ ↩2 ↩3 ↩4 ↩5
-
Grok 4.6의 API 가격은 100만 토큰당 입력 2.00달러, 출력 6.00달러. 전 세대 Grok 4.5(2026년 7월 8일 공개)와 같은 금액으로 동결이며, xAI는 이것을 「half the price of other frontier models(다른 프런티어 모델의 반액)」로 자리매김하고 있다. https://www.basenor.com/blogs/news/xai-launches-grok-4-6-1753-elo-half-the-price-of-rival-frontier-models / 컨텍스트 길이는 50만 토큰. 프롬프트가 20만 토큰 이상이 되면 입력 4.00달러, 출력 12.00달러로 배가된다. 웹 검색, X 검색, 코드 실행은 각각 1,000회당 5.00달러, 컬렉션 검색은 1,000회당 2.50달러의 별도 과금. 소비자용은 SuperGrok Heavy가 월 300달러, SuperGrok이 30달러, SuperGrok Lite가 10달러. 캐시 입력의 할인율은 출처에 따라 0.30달러(85% 할인)와 0.50달러(75% 할인)의 기재가 갈리며, 본 기사에서는 확정값으로 다루지 않는다. https://benchlm.ai/xai/api-pricing / https://www.aipricing.guru/xai-pricing/ ↩ ↩2 ↩3
-
DeepSeek-V4-Flash는 100만 토큰당 입력 0.14달러, 출력 0.28달러. DeepSeek-V4-Pro는 입력 0.435달러, 출력 0.87달러. Kimi K2.6은 0.95달러/4.00달러로 256K 컨텍스트, SWE-bench Verified에서 80.2%, 오픈 웨이트. Kimi K3는 3달러/15달러. SWE-bench Verified에서 80.2%부터 80.6%의 대역에 DeepSeek V4 Pro Max, Gemini 3.1 Pro, MiniMax M3, Qwen3.7 Max, Kimi K2.6의 5개 모델이 늘어서고, 이 대역의 출력 가격은 100만 토큰당 2.40달러(MiniMax M3)부터 12달러(Gemini 3.1 Pro)까지 벌어진다. DeepSeek V4 Pro Max는 오픈 웨이트로 제공된다. https://deepseek.ai/pricing / https://benchlm.ai/moonshot/api-pricing / https://www.morphllm.com/llm-api ↩ ↩2 ↩3
-
Grok Imagine은 이미지와 영상 생성을 담당하는 모델군. 이미지는 1장 0.02달러(고속), 품질 중시 그레이드는 1K에서 0.05달러, 2K에서 0.07달러. 영상(1.0 및 1.5)은 1초부터 15초의 클립을 최대 1080p로 생성하고, 음성을 같은 패스로 생성한다. API 가격은 480p에서 초당 0.05달러, 720p에서 0.07달러, 음성을 같은 패스로 생성하는 경우는 초당 0.08달러(음악, 효과음, 대사를 별도 공정의 음성 처리를 거치지 않고 같은 생성 안에서 만든다). Grok Imagine Video 1.5는 텍스트에서 영상, 이미지에서 영상, 참조 이미지에서 영상에 대응하며, 텍스트 및 이미지에서의 생성은 네이티브 1080p에 대응한다. https://www.aipricing.guru/xai-pricing/ / https://felloai.com/grok-imagine-video-generation/ / https://invideo.io/blog/grok-imagine-ai-generator/ / 본 기사 집필 시점에 Anthropic의 Claude는 이미지, 음성, 영상 생성 기능을 제공하지 않는다. ↩ ↩2 ↩3
-
Amazon Bedrock에서의 xAI 모델 제공 상황. 2026년 6월에 Grok 4.3이 Amazon Bedrock에서 제공을 시작했고, 2026년 7월에 AWS GovCloud(US-West)에서도 제공을 시작했다. 리전 내 추론에 대응하는 것은 미국 서부(오리건), 미국 동부(버지니아 북부), 미국 동부(오하이오)이며, 본 기사 집필 시점에 아시아 태평양(도쿄, ap-northeast-1)은 포함되어 있지 않다. 또한 Bedrock에 제공되어 있는 것은 Grok 4.3이며, 2026년 8월 12일 공개의 Grok 4.6이 아니다. 데이터 보존에 대해 AWS는
store=false의 지정만으로는 보존 제로를 보증하지 않으며, 확실히 제로의 영속 보존으로 하려면 실효적인 데이터 보존 모드가none이고 그 모드를 허용하는 모델일 것이 필요하다고 한다. https://aws.amazon.com/about-aws/whats-new/2026/06/grok-amazon-bedrock/ / https://aws.amazon.com/about-aws/whats-new/2026/07/grok-4-3-bedrock-govcloud/ / https://docs.aws.amazon.com/bedrock/latest/userguide/models-regions.html / https://www.techi.com/grok-bedrock-portability-retention-regions/ ↩ ↩2 ↩3 -
xAI의 데이터 보존에 관한 사양. 기본값에서는 API의 요청 및 응답이 감사 목적으로 30일간 서버에 저장되며(저장 시 암호화), 해당 데이터로의 학습은 이루어지지 않고 30일 후 자동 삭제된다. ZDR(Zero Data Retention)을 켜면 API 요청의 입력(프롬프트) 및 출력(생성 토큰)은 디스크에 영속화되지 않는다. ZDR은 팀 단위의 설정이며, 특정 API 키만을 대상으로 켤 수는 없다. https://docs.x.ai/developers/faq/security / ZDR이 추가 요금 없이 설정으로 켤 수 있다는 점은 본 기사 집필 시점에 저희가 확인한 범위에 의한 기술이다. 또한 xAI의 공식 계정은 「For teams using zero data retention, no trace and code data is ever retained. All API key use of Grok Build also respects ZDR. If ZDR is disabled, the /privacy command is available in the CLI to disable data retention, which also deletes previously synced data.」라고 설명하고 있다. https://x.com/SpaceXAI/status/2076692402442846289 ↩ ↩2 ↩3 ↩4
-
2026년 7월, Grok Build가 읽은 파일에 그치지 않고 Git 저장소 전체를 xAI 스토리지로 업로드하고 있었다는 것, 그리고 당시의 프라이버시 설정이 기대대로 기능하지 않았다는 것이 보도되었다. https://thehackernews.com/2026/07/grok-build-uploads-entire-git.html / https://www.techtimes.com/articles/320420/20260714/grok-build-shipped-entire-codebases-xai-cloud-privacy-toggle-did-nothing.htm / 이에 대해 SpaceXAI는 Grok Build가 출시 이후 ZDR을 완전히 존중해 왔으며, 이용자는 항상 CLI에서 데이터 업로드를 끌 수 있고 그 선택은 존중되어 왔다고 설명하고 있다. https://x.com/SpaceXAI/status/2077494536788664782 / 사실 관계에는 쌍방 설명의 어긋남이 남아 있으며, 본 기사는 어느 쪽이 정확한지의 판정을 하지 않는다. ↩






