Grok 4.7: benchmark, vídeo 4.7 vs 4.6 e o teste que vale no seu repo
O que a xAI publicou no Grok 4.7 (CursorBench, preço, tokens), o vídeo lado a lado da cidade 3D contra o 4.6, e como comparar no Cursor sem inventar ranking.
Saiu modelo novo. A pergunta útil não é "ele é o melhor?". É: onde isso entra amanhã, no projeto que você já paga.
A xAI lançou o Grok 4.7 focado em código, agentes e trabalho de conhecimento. Mesmo preço e velocidade do 4.6, base maior, RL mais longo em tarefas de horas. Disponível no Cursor, Grok Build e API.
O que o anúncio mede (números, não vibe)
| Grok 4.7 | Grok 4.6 | GPT-5.6 Sol Max | Fable 5.1 Max | |
|---|---|---|---|---|
| Input $/1M tokens | 2 | 2 | 4 | 10 |
| Output $/1M tokens | 6 | 6 | 20 | 50 |
| CursorBench 4.0 | 46,3% | 40,4% | 41,7% | 51,8% |
| DeepSWE v1.1 | 71,0%* | 65,2% | 72,7% | 70,0% |
| EEBench | 64,0% | 53,0% | 39,4% | 56,4% |
| Terminal-Bench 4.0 | 37,6% | 20,3% | 37,3% | 57,9% |
| Harvey Legal Agent | 19,6% | 15,8% | 2,5% | 6,7% |
* high effort. Contexto: 500k tokens. Variante Fast: 2× velocidade de saída, 2× preço (Cursor/Build; sem API pública no anúncio).
Em análises de terceiros (ex. Artificial Analysis), o modo xhigh do 4.7 consumiu ~81k tokens de saída por tarefa de inteligência, contra ~36k do 4.6. Mais capaz, mais verbose: custo real = preço × tokens, não só a tabela.
O vídeo que o anúncio usa como prova visual
A xAI postou comparação lado a lado: Grok 4.7 (primeiro) e 4.6 (segundo) montando o mesmo jogo de cidade open-world. O 4.7 aparece com modelagem mais densa (prédio, rua, luz). O 4.6 ainda lembra mini-game mais flat. Isso não é CursorBench. É demo de geração longa. Serve pra ver comportamento, não pra fechar compra.
Há também relatos de rede (Blender / Age of Empires estilo) com side-by-side 4.6 vs 4.7. Trate como impressão visual, com o mesmo critério: harness e prompt iguais, ou a comparação não vale.
O teste que vale no seu fluxo
Se você já usa Claude Code:
- Abre o mesmo projeto no Cursor.
- Seleciona Grok 4.7.
- Pede a mesma tarefa que pediria ao Claude: bug real, teste, refactor de um módulo.
- Anota três coisas: acerto na 1ª tentativa, tempo até solução usável, quanto você corrigiu na mão.
- Se for agente com ferramentas, testa também no Build harness (o Elon pediu isso explicitamente).
Notícia vira uso quando você troca o modelo no seletor. Não quando você só lê o thread.
O que não fazer
- Trocar o stack inteiro no dia do anúncio.
- Copiar score de leaderboard sem saber o harness.
- Misturar "mais inteligente" com "mais barato no meu volume" (tokens de saída sobem).