01 · EL ARGUMENTO
Tres buenas razones y los límites que nadie menciona.
Un modelo local es peor que un modelo alojado de primera línea en casi cualquier tarea. También es la única opción cuando los datos no pueden salir del equipo, y conviene entender ese intercambio con precisión.
Lo que sí te da lo local
- Los datos no salen. Sin términos de servicio, sin política de retención, sin dudas sobre entrenamiento. Para material de clientes, notas médicas, borradores legales o cualquier cosa bajo acuerdo de confidencialidad, ese es todo el argumento.
- Funciona sin conexión. En un avión, en un laboratorio, en una obra sin cobertura o durante una caída del proveedor.
- Sin coste por token ni límites de uso. Clasificación masiva, resúmenes por lotes y experimentos repetidos salen gratis después de la electricidad.
- No lo pueden retirar bajo tus pies. El modelo que guardaste se comporta igual dentro de dos años. Los modelos alojados cambian sin avisar.
Lo que no te da
- Razonamiento de frontera. Un modelo que cabe en memoria de vídeo de consumo no compite con los mayores modelos alojados en razonamiento difícil ni en conocimiento poco común.
- Velocidad con contexto largo. Procesar un documento grande es justo donde el hardware de consumo se nota más lento.
- Menos errores con aplomo. Los modelos pequeños alucinan más, no menos. Local no significa cuidadoso.
- Memoria gratis. Lo que ocupa el modelo es memoria que no tiene el resto de tu trabajo.
02 · EL PRESUPUESTO
La memoria lo decide todo. Esta es la aritmética.
Tamaño del modelo en miles de millones de parámetros, multiplicado por los bytes por parámetro de tu cuantización, más espacio para la ventana de contexto. Ese es todo el cálculo.
| Tamaño | A 4 bits | A 8 bits | Realista en |
|---|---|---|---|
| 3B | unos 2 GB | unos 3,5 GB | Cualquier GPU moderna, o solo CPU |
| 7B a 8B | unos 4,5 GB | unos 8,5 GB | 8 GB de VRAM con holgura; 16 GB de RAM en CPU |
| 13B a 14B | unos 8 GB | unos 15 GB | 12 GB de VRAM; lento pero usable en CPU |
| 30B a 34B | unos 19 GB | unos 36 GB | 24 GB de VRAM, o un portátil de memoria unificada |
| 70B | unos 40 GB | unos 75 GB | Dos GPU grandes, o 64 GB de memoria unificada, despacio |
Añade margen sobre cada cifra. La caché de claves y valores crece con el texto que introduces, y un contexto largo en un modelo grande consume varios gigabytes más. Un modelo que apenas cabe con el contexto vacío fallará a mitad de un documento largo.
La cuantización en un párrafo
Los pesos se almacenan con menor precisión para que el modelo ocupe menos. Pasar de 16 a 8 bits es casi gratis en calidad. De 8 a 4 bits es el punto dulce que usa casi todo el mundo: una pérdida pequeña y normalmente aceptable a cambio de aproximadamente la mitad de memoria. Por debajo de 4 bits la degradación se vuelve evidente, empezando por el seguimiento de instrucciones. Un modelo más grande a 4 bits suele superar a uno más pequeño a 8 bits, y esa es la regla más útil de todo el tema.
¿GPU o CPU? La GPU es alrededor de un orden de magnitud más rápida generando. La inferencia en CPU es perfectamente usable para modelos de 3B a 8B si aceptas velocidad de lectura. Los equipos de memoria unificada rinden especialmente bien.
03 · LAS HERRAMIENTAS
Cuatro formas de ejecutar los mismos archivos.
| Herramienta | Formato | Ideal para | Contrapartida |
|---|---|---|---|
| Ollama | Línea de comandos más API HTTP local | Desarrolladores. Un comando para descargar y ejecutar, y una API para otras herramientas. | Menos control fino que llama.cpp directo |
| LM Studio | Aplicación de escritorio | Probar y comparar modelos, y uso no técnico. Catálogo y chat incluidos. | Flujo gráfico, instalación más pesada |
| llama.cpp | El motor que hay debajo | Control total sobre cuantización, descarga de capas y muestreo. | El flujo de trabajo lo montas tú |
| Jan / GPT4All | Aplicaciones de escritorio | Un asistente privado para quien no quiere terminal | Menos ajustes, formatos nuevos más tarde |
Las cuatro ejecutan los mismos archivos cuantizados, así que la elección va de flujo de trabajo, no de capacidad. Un montaje habitual es Ollama como motor y una interfaz de chat aparte apuntando a su API.
04 · PASO A PASO
De cero a un modelo funcionando en unos diez minutos.
# Descarga un modelo acorde a tu hardware y empieza a chatear
ollama run llama3.1:8b
# Ver qué has descargado y cuánto ocupa
ollama list
# Eliminar lo que ya no quieres
ollama rm llama3.1:8b
# Servir la API local para otras herramientas
ollama serve
La API escucha en localhost, que es adonde se conectan los complementos del editor, las aplicaciones de notas y tus scripts. Nada sale del equipo.
curl http://localhost:11434/api/generate -d '{
"model": "llama3.1:8b",
"prompt": "Resume esto en tres puntos: ...",
"stream": false
}'
Qué modelo elegir primero
- Asistente general con 8 GB de VRAM — un modelo instruido actual de 7B a 8B a 4 bits. Es la respuesta por defecto y es buena.
- Código — un modelo especializado del mismo tamaño. Claramente mejor completando y refactorizando que uno general equivalente.
- Pequeño y rápido — un modelo de 3B para clasificación, extracción y etiquetado, donde no necesitas conversación.
- La mejor calidad que quepa — sube en parámetros antes que en precisión.
Revisa la licencia antes de construir sobre el modelo. Pesos abiertos no es lo mismo que código abierto: varias familias populares restringen el uso comercial o imponen condiciones a los modelos derivados.
05 · AJUSTES
Cuatro parámetros que deciden si resulta usable.
- Capas descargadas a la GPU. El ajuste más importante cuando el modelo no cabe entero. Envía a la GPU tantas capas como permita la VRAM; el resto lo calcula la CPU. Una capa de más provoca un fallo por falta de memoria.
- Ventana de contexto. Más contexto cuesta memoria y ralentiza la generación. Ponla en lo que realmente necesites: 4K para conversar, más solo cuando de verdad introduces documentos.
- Tamaño de lote al procesar el prompt. Afecta a la rapidez con la que se ingiere una entrada larga, aparte de la velocidad de salida.
- Nivel de cuantización. Si no cabe, baja de 5 a 4 bits antes de cambiar a un modelo más pequeño.
| Configuración | 7B a 8B a 4 bits | Se siente como |
|---|---|---|
| GPU dedicada moderna, todo descargado | Rápido, muy por encima de la velocidad de lectura | Comparable a un chat alojado |
| GPU antigua o pequeña, descarga parcial | En torno a la velocidad de lectura | Válido para conversar, tedioso para respuestas largas |
| Solo CPU, multinúcleo moderno | Por debajo de la velocidad de lectura | Bien para tareas de fondo y por lotes |
| Portátil de memoria unificada | Cómodamente por encima de la lectura | La mejor experiencia por vatio disponible hoy |
Si la generación va mucho más lenta que la tabla, es casi seguro que el modelo se está desbordando de la VRAM a la memoria del sistema. Revisa la descarga de capas antes de culpar al hardware.
06 · VERIFICACIÓN
Demuestra que el modelo funciona sin red.
Este es el paso que separa una instalación realmente local de una interfaz local delante de una API remota. Hazlo una vez, a conciencia.
Baja todos los modelos que vayas a usar mientras tengas conexión. Los archivos del modelo son lo único que necesita red de verdad.
Apaga el Wi-Fi y desenchufa el cable. El modo avión vale. No te fíes de una regla de cortafuegos para la prueba.
No una prueba de una palabra. Pide algo lo bastante largo como para que una vuelta silenciosa a un servicio remoto falle de forma visible.
El uso de GPU o CPU debe subir mientras genera. Si no se mueve nada en local, está respondiendo otro.
Mantenerlo sin conexión después
- Bloquea la salida a red del motor en el cortafuegos una vez descargados los modelos. Actualiza de forma deliberada.
- Desactiva telemetría y comprobación de actualizaciones en la herramienta que hayas elegido.
- Guarda copia de los archivos del modelo. Son grandes pero no infinitos, y un modelo retirado o relicenciado no se recupera sin copia.
- Cuidado con las interfaces de chat. Muchas admiten proveedores locales y alojados, y cambiar es un desplegable. Comprueba cuál está seleccionado antes de pegar algo sensible.
La promesa de privacidad vale lo que su eslabón más débil. Un modelo local detrás de una interfaz que sincroniza tu historial con una cuenta en la nube no es una instalación privada. Verifica cada pieza por separado.
07 · RESPUESTAS RÁPIDAS
Modelos locales, en breve.
Para un modelo de 7B a 8B con cuantización de 4 bits, unos 4,5 GB de memoria de vídeo, de modo que una tarjeta de 8 GB va holgada. Solo con CPU funciona con unos 16 GB de RAM del sistema, aunque genera por debajo de la velocidad de lectura. Los equipos de memoria unificada rinden especialmente bien porque la memoria es compartida y amplia.
No en los tamaños que caben en hardware de consumo. Espera un asistente competente para resumir, redactar, extraer datos y trabajo rutinario de código, y espera que quede por detrás en razonamiento difícil y conocimiento poco común. La razón para ejecutarlo en local es la privacidad, la disponibilidad sin conexión y el coste.
De 16 a 8 bits es casi gratis. De 8 a 4 bits cuesta una pérdida pequeña y normalmente aceptable a cambio de aproximadamente la mitad de memoria, por eso casi todo el mundo usa 4 bits. Por debajo de 4 bits la degradación es evidente, empezando por el seguimiento de instrucciones. Como regla, un modelo mayor a 4 bits supera a uno menor a 8 bits.
Ollama si quieres línea de comandos y una API local que otras herramientas puedan llamar. LM Studio si prefieres una aplicación de escritorio con catálogo de modelos y chat integrado. llama.cpp directamente si quieres control total sobre la cuantización y la descarga de capas. Las tres ejecutan los mismos archivos.
Descarga los modelos con conexión, desconecta la red por completo y lanza una petición sustancial. Observa cómo sube el uso de GPU o CPU mientras genera. Después bloquea la salida a red del motor en el cortafuegos y comprueba que tu interfaz de chat no esté configurada para recurrir a un proveedor alojado.