Versão do benchmark: 2026-06-25Dados consultados: 2026-09-22Versão verificada · consultando fonte
22 modelos abertos avaliados no catálogo · 8 referências de fronteira. O padrão mostra uma seleção; a busca explora o catálogo completo.
Escolher modelos 9/36
Choose hardware · 3/6Select a machine below the axis to explore its capacity and price.
9 modelos nesta visualização
Deslize o gráfico para os lados ou use a Tabela para comparar de forma compacta.
Mais alto = melhor resultado no benchmark. À esquerda = menos memória estimada. Clique num ponto para ver a fonte. O eixo Y se adapta à seleção.
* USD, US market. Select a machine for the exact configuration, price basis and dated official source. Hardware photos are illustrative. PNG exports the chart and active capacity overlay.
Fora do gráfico: DeepSeek V4.1 Flash · max (81.1; estimativa de memória pendente)
Base dos parâmetros: componente de linguagem. Dense. O contexto pode ser estendido até 1.000.000 tokens com configuração adicional; isso altera a necessidade de memória. Detalhes técnicos consultados em 22/09/2026.
A estimativa dos pesos Q4 exclui runtime e cache. A memória de planejamento adiciona uma folga heurística; nenhuma é um requisito medido. As categorias descrevem a variante exata do benchmark, não uma quantização local.
Fontes, premissas e limites
01 / LiveBench
O score geral é a média, com pesos iguais, das médias de sete categorias (0–100). Todos os scores usam a mesma versão. Este não é o Intelligence Index do Artificial Analysis; as escalas não devem ser misturadas.
Fórmula de planejamento: parâmetros totais × 0,625 bytes, mais 20% de folga e 8 GB de reserva, arredondados para cima em GB decimais. É uma heurística, não um mínimo medido ou garantia. Quantização, contexto, cache KV, componentes visuais, runtime e offload alteram a exigência. MoE usa parâmetros totais, não só os ativos.
Qwen usa parâmetros de linguagem; GLM-5.3 e DeepSeek V4 usam contagens de tensores; GLM-5.3 Flash usa a especificação de 320B do fabricante. Arquiteturas sem estimativa revisada ficam fora do eixo de memória.
03 / Referência, não teste local
O LiveBench avalia o modelo e o esforço de raciocínio indicados. O score não mede a variante local Q4. Os links de hardware são oficiais, sem afiliados. Estoque, configuração exata e disponibilidade regional podem mudar.
04 / Atualizações sem APIs pagas
Resultados publicados são consultados quando a página recebe visitas e mantidos em cache por até 24 horas quando disponível. Nenhuma inferência é executada. Se um modelo desaparecer, um score mudar mais de 10 pontos ou o formato/versão mudar, a versão verificada salva continua visível. Novas versões e associações de hardware exigem revisão.