Calculadora de IA local

¿Corre la IA en tu ordenador?

Depende de una sola cifra que casi nadie mira: el ancho de banda de la memoria de tu gráfica. Pulsa y te digo qué modelos mueves, a qué velocidad y cuáles no te caben.

Detección local — nada sale de tu navegador en espera

La detección usa WebGPU y WebGL para leer el modelo de tu gráfica. No se envía nada a ningún servidor: esta página no tiene backend.

¿No acierta con tu gráfica?

Metodología

De dónde salen estos números

Generar texto con un modelo de lenguaje no es un problema de cálculo, es un problema de mover memoria. Por cada palabra que escribe, la tarjeta tiene que leer entero el modelo. Así que la velocidad sale de dividir el ancho de banda de la memoria entre lo que ocupa el modelo.

tokens/s ≈ 0,81 × ancho de banda (GB/s) ÷ tamaño del modelo (GB)

Ese 0,81 no es un número elegido a ojo: es el rendimiento real que se pierde por el camino, calculado contra las medidas de abajo. Son ejecuciones reales con Ollama en una RTX 3070 Ti, no cifras de fabricante.

Medido en una RTX 3070 Ti · 608 GB/s 8 septiembre 2026
ModeloOcupaMedidoLa fórmula decíaError
gemma3:4b3,3 GB135,9 tok/s149,2+10%
qwen2.5:7b4,7 GB109,0 tok/s104,8−4%
qwen2.5-coder:7b4,7 GB109,0 tok/s104,8−4%
deepseek-r1:7b4,7 GB110,6 tok/s104,8−5%
qwen3:8b5,2 GB93,6 tok/s94,7+1%
gemma3:4b sin GPU3,3 GB8,4 tok/s7,1−15%
qwen2.5:7b sin GPU4,7 GB4,5 tok/s5,0+12%

Cuantización Q4_K_M, contexto por defecto, sin razonamiento extendido. Las dos últimas filas son los mismos modelos forzados a CPU en la misma máquina: entre 16 y 24 veces más lento. Esa es la diferencia real entre tener gráfica y no tenerla, medida y no estimada. En CPU la fórmula ajusta peor (±15%) porque el ancho de banda aprovechable cae según crece el modelo.

Para el resto de tarjetas la velocidad es una estimación con esa misma fórmula y el ancho de banda oficial de cada modelo de GPU. Contra las seis medidas reales acierta con menos de un 10% de error, pero es una estimación: tu caso puede variar según cuantización, contexto y qué más esté haciendo la máquina.

Lo que casi nadie te cuenta

Tres cosas que cambian el resultado más que la gráfica

1. Si el modelo no cabe entero, te comes la CPU. Cuando el modelo pasa de tu memoria de vídeo, la parte que sobra se ejecuta en el procesador y arrastra a todo lo demás. No baja un 20%: puede bajar diez veces. Por eso la tabla marca en rojo lo que no cabe, en vez de darte un número optimista.

2. El contexto también ocupa memoria. El modelo es solo una parte. Cuanto más largo el historial de la conversación o el documento que le pasas, más memoria hace falta además del modelo. Deja siempre un margen de 1 a 2 GB.

3. Los modelos con razonamiento parecen lentos y no lo son. Piensan en voz alta antes de responder, así que tardan mucho más en darte la primera palabra aunque generen a la misma velocidad. Se les puede desactivar el razonamiento y responden al instante.

Y ahora qué

Saber que te cabe es el paso cero

Instalar un modelo y hablarle es media tarde y hay guías gratis de sobra. Lo que cambia algo es lo siguiente: que lea tus documentos y te cite de dónde saca cada respuesta, que te conteste en Telegram desde tu casa, que te resuma el correo cada mañana y que siga en pie después de un reinicio.

Ver el curso completo · 67 €