
Si no quieres depender de ChatGPT, Claude o Gemini para cada consulta, y prefieres tener tus datos en tu máquina sin enviarlos a ningún servidor, LM Studio es la herramienta que buscas. Y si lo tuyo es ir un paso más allá y que la IA trabaje por ti —creando documentos, escribiendo código o investigando—, LM Studio Bionic es su nuevo hermano agente.
En esta guía te cuento qué hacen, cómo instalarlos, qué hardware necesitas según tu equipo y cómo sacarles partido en el día a día.
¿Qué es LM Studio?
LM Studio es una aplicación de escritorio (Windows, Mac, Linux) que te permite descargar y ejecutar modelos de lenguaje (LLMs) en local. Sin enviar datos a ninguna nube, sin cuentas obligatorias, sin límites artificiales de mensajes.
Incluye un navegador de modelos integrado que se conecta directamente a Hugging Face. Buscas un modelo, le das a descargar y en cinco minutos estás chateando con él. También puedes subir archivos (PDF, DOCX, TXT) y el modelo los procesa con RAG integrado.
LM Studio vs LM Studio Bionic
-
Enfoque
- LM Studio (clásico): Chat con modelos locales
- LM Studio Bionic: Agente que trabaja con archivos y código
-
Interfaz
- LM Studio (clásico): Chat simple tipo ChatGPT
- LM Studio Bionic: Proyectos con sesiones múltiples
-
Subir archivos
- LM Studio (clásico): Sí, RAG integrado
- LM Studio Bionic: Sí, con sandbox y previsualización
-
Editar código
- LM Studio (clásico): No
- LM Studio Bionic: Sí (git, shell, búsqueda, diffs)
-
Crear documentos
- LM Studio (clásico): No
- LM Studio Bionic: Sí (PDF, presentaciones, hojas)
-
Modelos cloud
- LM Studio (clásico): No
- LM Studio Bionic: Sí (Zero Data Retention)
-
Precio
- LM Studio (clásico): Gratuito 100%
- LM Studio Bionic: Freemium (modelos cloud de pago)
-
Peso
- LM Studio (clásico): App ligera (~150 MB)
- LM Studio Bionic: App más completa (~400 MB)
Puedes tener ambas instaladas y usarlas para cosas distintas. Bionic no sustituye a LM Studio; la app clásica sigue siendo mejor para consultas rápidas y chats informales.
Requisitos de hardware
Ejecutar modelos de lenguaje localmente depende de tres componentes: VRAM (si tienes GPU), RAM del sistema (si usas CPU o Apple Silicon) y, en menor medida, la CPU. La VRAM es el cuello de botella principal si tienes gráfica dedicada.
PC con GPU dedicada (NVIDIA / AMD)
Lo que importa aquí es la VRAM de la tarjeta gráfica, no la RAM del sistema. La CPU también influye: un procesador moderno acelera la evaluación de tokens en carga inicial, pero una vez el modelo está en VRAM, la GPU hace casi todo el trabajo.
-
4–6 GB VRAM
- Modelos 1B–3B (cuantización Q4)
- Ejemplos: Phi-3 Mini, Llama 3.2 3B, Qwen 2.5 3B
-
8 GB VRAM
- Modelos 7B (cuantización Q4/Q5)
- Ejemplos: Mistral 7B, Llama 3 8B, Gemma 2 9B
-
12 GB VRAM
- Modelos 7B–13B (cuantización Q4/Q5)
- Ejemplos: Qwen 2.5 14B, Llama 3.1 8B, DeepSeek-Coder-V2
-
16 GB VRAM
- Modelos 13B–20B (cuantización Q4)
- Ejemplos: Mixtral 8x7B, Command R, Llama 3 70B (Q2 fuerte)
-
24 GB VRAM
- Modelos 30B–70B (cuantización Q4)
- Ejemplos: Llama 3.1 70B, Qwen 2.5 72B, DeepSeek-R1
-
48 GB+ VRAM
- Modelos 70B+ sin cuantizar
- Ejemplos: Qwen 3, Llama 4, Gemma 4 27B
Nota importante: si tu GPU tiene poca VRAM, LM Studio puede usar offloading parcial: parte del modelo se ejecuta en GPU y el resto en RAM del sistema. Es más lento, pero te permite ejecutar modelos que no caben enteros en VRAM.
PC sin GPU dedicada (solo CPU)
Aquí importa la RAM del sistema y la velocidad de la CPU. Sin GPU, la inferencia es más lenta, pero viable para modelos pequeños con cuantización agresiva. Un procesador con soporte AVX2 (Intel 8ª gen o AMD Ryzen 3000 en adelante) acelera llama.cpp significativamente.
-
8 GB RAM
- Modelos 1B–3B (Q4)
- Velocidad estimada: 20–40 tokens por segundo
-
16 GB RAM
- Modelos 7B (Q4)
- Velocidad estimada: 8–15 tokens por segundo
-
32 GB RAM
- Modelos 13B (Q4)
- Velocidad estimada: 4–8 tokens por segundo
-
64 GB RAM
- Modelos 30B (Q4)
- Velocidad estimada: 2–4 tokens por segundo
Notas sobre velocidad: por debajo de 5 t/s la conversación se vuelve incómoda; por encima de 15 t/s se siente fluida.
Apple Silicon (Mac)
La memoria unificada de Apple hace que la GPU acceda directamente a toda la RAM del sistema. Esto es una ventaja enorme: un Mac con 32 GB puede ejecutar modelos que un PC con 8 GB de VRAM no puede ni intentar. El chip también importa: los M3/M4 tienen Neural Engine y mayor ancho de banda de memoria.
-
M1/M2 8 GB
- Modelos 1B–3B
-
M1/M2 16 GB
- Modelos 7B–8B (Q4), Llama 4 Scout 17B justo
-
M3/M4 24 GB
- Modelos 7B–13B fluido, 17B cómodo
-
M3/M4 Max 36–64 GB
- Modelos 30B–70B
-
Mac Studio 96–192 GB
- Modelos 70B+ sin cuantizar
1. Instalación de LM Studio
Ve a lmstudio.ai y descarga el instalador. La web detecta tu sistema operativo automáticamente.
- Windows: descarga el .exe e instala como cualquier programa
- Mac: descarga el .dmg y arrastra al icono de Applications
- Linux: descarga el .AppImage, da permisos y ejecuta
chmod +x LM_Studio-*.AppImage
./LM_Studio-*.AppImageAl abrirlo por primera vez ves una interfaz con tres secciones principales:
- Discover — Buscar y descargar modelos desde Hugging Face
- My Models — Tus modelos descargados
- Chat — La interfaz de chat con el modelo cargado
2. Descargar tu primer modelo
En la pestaña Discover puedes buscar modelos por nombre. Cada modelo aparece con una tarjeta que muestra tamaño, cuantizaciones disponibles y una descripción.
Para empezar, busca la versión GGUF del modelo (es el formato estándar que usa LM Studio). Los GGUF tienen etiquetas que indican el nivel de cuantización:
- Q2_K: 2 bits – Baja – ~4 GB (7B)
- Q4_K_M: 4.5 bits – Buena – ~6 GB (7B)
- Q5_K_M: 5.5 bits – Muy buena – ~7 GB (7B)
- Q6_K: 6 bits – Excelente – ~8 GB (7B)
- Q8_0: 8 bits – Casi sin pérdida – ~10 GB (7B)
Recomendación práctica: empieza con Q4_K_M. Es el punto óptimo entre calidad y consumo de memoria. Si te sobra RAM, sube a Q5 o Q6. Si vas justo, baja a Q2.
Modelos recomendados por caso de uso
-
Chat general / asistencia
- Llama 3.2 3B (Q4) – ~2 GB – necesita 6 GB RAM
-
Chat general
- Qwen 2.5 7B (Q4) – ~4.5 GB – necesita 8 GB RAM
- Gemma 2 9B (Q4) – ~6 GB – necesita 12 GB RAM/VRAM
- Llama 3.1 8B (Q4) – ~5.5 GB – necesita 10 GB RAM/VRAM
-
Razonamiento
- DeepSeek-R1 7B (Q4) – ~5 GB – necesita 10 GB RAM/VRAM
- Qwen 2.5 14B (Q4) – ~9 GB – necesita 14 GB RAM/VRAM
-
Código
- DeepSeek-Coder-V2 (Q4) – ~12 GB – necesita 16 GB VRAM
- Qwen 2.5-Coder 7B (Q4) – ~5 GB – necesita 10 GB RAM/VRAM
-
Multimodal (imágenes)
- Qwen 2.5-VL 7B (Q4) – ~6 GB – necesita 12 GB RAM/VRAM
- Llama 4 Scout 17B (Q4) – ~11 GB – necesita 24 GB RAM
-
Máxima calidad local
- Qwen 3 32B (Q4) – ~20 GB – necesita 32 GB RAM/VRAM
3. Chatear con el modelo
Una vez descargado, ve a My Models, selecciona el modelo y haz clic en Load Model. LM Studio tarda unos segundos en cargarlo (depende del tamaño y tu disco).
# Ejemplo de lo que ves al cargar un modelo:
# Loading model: Qwen2.5-7B-Q4_K_M.gguf
# Using GPU: NVIDIA GTX 1050 (2 GB VRAM)
# Offloading 15/41 layers to GPU
# Load time: 4.2 secondsAjustes útiles en el panel de configuración:
- Temperature (0–2): cuanto más alto, más creativo. Para tareas factuales usa 0.1–0.3. Para escritura creativa, 0.7–0.9.
- Max Tokens: longitud máxima de la respuesta. 2048 para chat normal, 8192 para análisis largos.
- Context Length: ventana de contexto del modelo. No la subas más de lo que el modelo soporta.
- GPU Offload: cuántas capas del modelo se ejecutan en GPU. A más capas, más rápido, pero más VRAM consume.
Puedes subir archivos pinchando en el clip de la barra de mensajes. LM Studio los procesa con RAG: extrae los fragmentos relevantes y los pasa al modelo junto con tu pregunta.
4. Servidor API local (compatible con OpenAI)
LM Studio puede levantar un servidor con API compatible con OpenAI. Esto permite que otras aplicaciones (Cursor, Continue, OpenCode, cualquier cosa que hable con OpenAI API) usen tu modelo local.
# 1. Abre la pestaña Developer (icono de llave inglesa)
# 2. Haz clic en "Start Server"
# 3. El servidor arranca en http://localhost:1234Desde cualquier app, configuras la URL base:
# Ejemplo con curl (funciona como OpenAI):
curl http://localhost:1234/v1/chat/completions \
-H "Content-Type: application/json" \
-d '{
"model": "qwen-2.5-7b",
"messages": [{"role": "user", "content": "Hola"}]
}'# Ejemplo con Continue (VS Code):
# En config.json pones:
{
"models": [{
"title": "LM Studio Local",
"provider": "openai",
"apiBase": "http://localhost:1234/v1"
}]
}5. LM Studio Bionic: el agente para trabajo real
Bionic es la novedad de 2026. Se instala como una app separada desde lmstudio.ai/bionic. Mientras LM Studio clásico es un chat, Bionic es un agente que puede leer, escribir y modificar archivos por sí mismo.
Proyectos de trabajo (Work Projects)
Usa Bionic para tareas de investigación y documentación:
- Investigar: le pides que busque información en web y te sintetice los resultados
- Crear documentos: genera PDFs, presentaciones y hojas de cálculo
- Analizar archivos: procesa documentos largos, extrae conclusiones, compara versiones
- Escribir informes: redacta, corrige y da formato
Todo en un entorno sandbox: los archivos que crea o modifica se quedan en su espacio, puedes revisar los cambios y deshacerlos si no te convencen.
Proyectos de código (Code Projects)
Vinculas Bionic a una carpeta de tu proyecto y el agente puede:
- Leer y entender el código existente
- Hacer búsquedas en el código fuente
- Editar archivos con diffs en línea
- Ejecutar comandos de shell y git
- Depurar errores
Funciona con modelos abiertos como GLM 5.2 y Kimi K2.7 Code.
¿Dónde se ejecuta el modelo?
Bionic ofrece tres opciones:
- Local – en tu máquina, como LM Studio clásico
- LM Studio Secure Cloud – modelos más grandes en la nube con política de Zero Data Retention (no guardan tus datos)
- LM Link – un modelo que corre en otro dispositivo de tu red
La opción cloud requiere cuenta en LM Studio y tiene coste asociado. La opción local es gratuita.
Teclado por voz
Bionic incluye un teclado de voz que funciona en cualquier app del sistema. Dictas donde sea y la transcripción se procesa en local con el modelo Voxtral de Mistral. Sin internet, sin enviar audio a nadie.
También te puede interesar
Noticias GitHub Models cierra hoy: el playground de IA de la plataforma dice adiós definitivamente
Recursos Las 10 mejores herramientas de inteligencia artificial gratis en 2026
Recursos Micro: el editor de terminal que se parece a Sublime Text