La cifra que manda: la memoria de la tarjeta gráfica

Si te quedas solo con un dato de todo el artículo, que sea este: lo que determina qué modelos puedes ejecutar es la memoria de la tarjeta gráfica, lo que se conoce como VRAM. No el procesador, no la cantidad de disco, no la marca del equipo.

El motivo es que un modelo de lenguaje, para funcionar con soltura, tiene que caber entero en esa memoria. Si cabe, las respuestas salen a la velocidad a la que se lee. Si no cabe, el sistema empieza a tirar de la memoria normal del ordenador y el rendimiento se desploma: pasas de esperar dos segundos a esperar un minuto. No es que deje de funcionar, es que deja de ser usable.

Regla práctica: primero se decide qué modelo necesitas para las tareas que quieres cubrir, y entonces se compra la tarjeta que lo aloja. Hacerlo al revés —comprar equipo y ver qué cabe— es la forma más habitual de gastar de más y quedarse corto a la vez.

Cuánta memoria pide cada modelo

Los modelos se miden en parámetros, en miles de millones (la "B" de billion que verás en sus nombres: 8B, 14B, 32B). A más parámetros, más capacidad y más memoria necesaria.

La otra variable es la cuantización: una técnica que comprime el modelo para que ocupe menos, a cambio de una pérdida de precisión que, bien hecha, apenas se nota en el uso normal. Prácticamente todas las instalaciones locales la utilizan. Con cuantización de 4 bits, que es lo habitual, las cifras aproximadas quedan así:

Tamaño del modelo VRAM necesaria Para qué da
7B – 8B 6 – 8 GB Redactar, resumir, corregir, clasificar textos
13B – 14B 10 – 12 GB Lo anterior con más matiz y mejor seguimiento de instrucciones
30B – 32B 20 – 24 GB Documentos largos, análisis, consultas sobre archivos propios
70B 44 – 48 GB Tareas exigentes y varios usuarios a la vez

Son cifras orientativas y conviene tomárselas como tales: incluyen un margen para el contexto —el texto que el modelo tiene "en la cabeza" mientras trabaja—, que crece cuando le pasas documentos largos. Y cambian rápido: cada pocos meses aparecen modelos que hacen con 14B lo que antes pedía 30B.

El resto del equipo

Una vez resuelta la tarjeta gráfica, lo demás es menos crítico de lo que parece:

Memoria RAM

Conviene que sea igual o mayor que la VRAM, y a partir de 32 GB se trabaja cómodo. Es lo que permite cargar y cambiar de modelo sin esperas.

Procesador

Si hay tarjeta gráfica, deja de ser el cuello de botella. Un procesador de gama media actual sobra.

Disco

SSD NVMe, y con espacio. Cada modelo ocupa entre 5 y 45 GB, y en la práctica se acaban teniendo varios instalados para distintas tareas. Medio terabyte es un punto de partida sensato.

Red

Una red interna de gigabit basta de sobra. El tráfico entre los puestos y el servidor es texto, apenas pesa.

¿Y sin tarjeta gráfica?

Se puede. Un modelo pequeño se ejecuta en un procesador normal, y funcionará. Pero irá entre cinco y veinte veces más lento, hasta el punto de ver aparecer las palabras una a una. Sirve para probar y hacerse una idea; no sirve para trabajar todos los días.

Un caso aparte son los equipos de Apple con procesadores de la serie M: al compartir la memoria entre procesador y gráfica, un Mac con 32 o 64 GB puede mover modelos grandes con un rendimiento razonable y un consumo muy inferior al de una tarjeta dedicada. Para un profesional que trabaja solo, a veces es la opción más limpia.

Tres escenarios reales

12–16 GB
Una persona

Sobremesa con 32 GB de RAM. Modelos de hasta 14B.

24 GB
De tres a ocho

Máquina dedicada con 64 GB de RAM. Modelos de 30B.

48 GB
Con documentación propia

Formato servidor, para uso intensivo y continuado.

Una persona, uso diario

Un ordenador de sobremesa con una tarjeta gráfica de 12 a 16 GB y 32 GB de RAM. Mueve modelos de hasta 14B con holgura y cubre sin problema redactar, resumir, revisar y consultar documentos. Es el escenario más común y el más asequible.

Un equipo pequeño, de tres a ocho personas

Aquí ya conviene una máquina dedicada, no el ordenador de nadie: una tarjeta de 24 GB y 64 GB de RAM, encendida siempre, a la que se conectan todos los puestos desde la red interna. Permite modelos de 30B y varias consultas simultáneas sin que nadie note que hay otro usando el sistema.

Varios usuarios a la vez y documentación propia

Cuando además de responder preguntas el sistema tiene que buscar dentro de tus propios archivos, se suma una segunda carga de trabajo. Se resuelve con 48 GB de memoria gráfica —una tarjeta grande o dos medianas— y un equipo con formato de servidor. Es la configuración menos frecuente en un negocio pequeño, pero es la que aguanta un uso intensivo y continuado.

Lo que no aparece en la ficha técnica

Dimensionar la máquina es la mitad del trabajo. La otra mitad son las decisiones que no figuran en ningún catálogo y que determinan si la instalación aguanta:

  • Dónde se pone. Un equipo así consume y calienta. Necesita un sitio ventilado, con enchufe en condiciones, y preferiblemente no debajo de la mesa de quien atiende al público: hace ruido.
  • Corriente. Un SAI evita que un corte de luz interrumpa el trabajo o corrompa lo que haya en marcha.
  • Copias de seguridad. El modelo se puede volver a descargar; tus configuraciones y tus documentos indexados, no. Entran en el mismo plan de copias de seguridad que el resto del negocio.
  • Acceso. Definir qué equipos pueden usar el sistema y con qué permisos es parte de la instalación, no un extra.
  • Actualizaciones. Modelos y programas se renuevan a buen ritmo. Sin un mantenimiento previsto, en dos años tienes una máquina desactualizada.
Sigue leyendo

Copias de seguridad: la regla 3-2-1, el plan en el que entra también este equipo.

Antes de mirar precios

El error más caro es empezar por el catálogo. La secuencia sensata es la contraria: enumerar las tareas que quieres cubrir, ver qué tamaño de modelo las resuelve bien, calcular la memoria que ese modelo pide y comprar entonces, con un margen razonable para lo que venga después. De qué depende el precio en cada partida lo vemos en cuánto cuesta un servidor de IA local.

Es exactamente lo que hacemos en el diagnóstico inicial: valorar si tu equipo actual puede con ello o si hace falta uno dedicado —y, en ese caso, si conviene un equipo cerrado o una torre que puedas ampliar—, y dimensionarlo a tu volumen real de trabajo. Si todavía no tienes claro el concepto de fondo, empieza por qué es una IA local y en qué se diferencia de la IA en la nube; si el equipo va a trabajar con datos de clientes, conviene además repasar qué obligaciones de la Ley de IA te afectan; y si te quedan dudas sueltas, las preguntas frecuentes cubren las más habituales.