Grok 4.7: benchmark, vídeo 4.7 vs 4.6 e o teste que vale no seu repo

O que a xAI publicou no Grok 4.7 (CursorBench, preço, tokens), o vídeo lado a lado da cidade 3D contra o 4.6, e como comparar no Cursor sem inventar ranking.

Saiu modelo novo. A pergunta útil não é "ele é o melhor?". É: onde isso entra amanhã, no projeto que você já paga.

A xAI lançou o Grok 4.7 focado em código, agentes e trabalho de conhecimento. Mesmo preço e velocidade do 4.6, base maior, RL mais longo em tarefas de horas. Disponível no Cursor, Grok Build e API.

O que o anúncio mede (números, não vibe)

Do post oficial da xAI:

Grok 4.7Grok 4.6GPT-5.6 Sol MaxFable 5.1 Max
Input $/1M tokens22410
Output $/1M tokens662050
CursorBench 4.046,3%40,4%41,7%51,8%
DeepSWE v1.171,0%*65,2%72,7%70,0%
EEBench64,0%53,0%39,4%56,4%
Terminal-Bench 4.037,6%20,3%37,3%57,9%
Harvey Legal Agent19,6%15,8%2,5%6,7%

* high effort. Contexto: 500k tokens. Variante Fast: 2× velocidade de saída, 2× preço (Cursor/Build; sem API pública no anúncio).

Em análises de terceiros (ex. Artificial Analysis), o modo xhigh do 4.7 consumiu ~81k tokens de saída por tarefa de inteligência, contra ~36k do 4.6. Mais capaz, mais verbose: custo real = preço × tokens, não só a tabela.

O vídeo que o anúncio usa como prova visual

A xAI postou comparação lado a lado: Grok 4.7 (primeiro) e 4.6 (segundo) montando o mesmo jogo de cidade open-world. O 4.7 aparece com modelagem mais densa (prédio, rua, luz). O 4.6 ainda lembra mini-game mais flat. Isso não é CursorBench. É demo de geração longa. Serve pra ver comportamento, não pra fechar compra.

Há também relatos de rede (Blender / Age of Empires estilo) com side-by-side 4.6 vs 4.7. Trate como impressão visual, com o mesmo critério: harness e prompt iguais, ou a comparação não vale.

O teste que vale no seu fluxo

Se você já usa Claude Code:

  1. Abre o mesmo projeto no Cursor.
  2. Seleciona Grok 4.7.
  3. Pede a mesma tarefa que pediria ao Claude: bug real, teste, refactor de um módulo.
  4. Anota três coisas: acerto na 1ª tentativa, tempo até solução usável, quanto você corrigiu na mão.
  5. Se for agente com ferramentas, testa também no Build harness (o Elon pediu isso explicitamente).

Notícia vira uso quando você troca o modelo no seletor. Não quando você só lê o thread.

O que não fazer

  • Trocar o stack inteiro no dia do anúncio.
  • Copiar score de leaderboard sem saber o harness.
  • Misturar "mais inteligente" com "mais barato no meu volume" (tokens de saída sobem).

Fontes