Volver al blog

IA local: un agente que trabaja 24 horas sin pagar por token

Qwen 3.8 sale con pesos abiertos y cabe en una tarjeta gráfica de gama media. Así usamos la IA local en Sozpic para agentes que vigilan webs las 24 horas sin factura por token.

Ilustración plana: un pequeño servidor con una tarjeta gráfica encendida sobre una mesa, de noche, conectado a varias ventanas de navegador con marcas de verificación y una con un aviso

Un agente de IA que revisa tu web a las tres de la mañana no es caro por lo que hace, es caro por cómo se paga: cada comprobación pasa por la API de un gran proveedor y suma tokens a la factura. La IA local le da la vuelta a eso. El modelo corre en un servidor tuyo, en una tarjeta gráfica que cuesta lo que un portátil decente, y trabaja las 24 horas sin contador. Desde Murcia llevamos meses montando agentes así, y el 26 de agosto Alibaba puso otra pieza sobre la mesa: los pesos abiertos de Qwen 3.8.

Qué es la IA local y qué no es

IA local significa ejecutar un modelo de lenguaje en hardware propio, en tu oficina o en un servidor que alquilas, en vez de enviar cada consulta a los servidores de OpenAI, Google o Anthropic. El modelo tiene que ser abierto: sus pesos se descargan y se instalan. Eso descarta a los grandes nombres cerrados y deja en la mesa a familias como Llama, Mistral, DeepSeek o Qwen.

Lo que no es: gratis ni mágico. Hay que comprar o alquilar la máquina, mantenerla y aceptar que un modelo que cabe en una tarjeta de 16 GB no razona como el mejor modelo de frontera del momento. En nuestro propio Ranking IA, los primeros puestos siguen siendo de modelos cerrados. La pregunta útil no es cuál es mejor, sino para qué tarea basta con el abierto.

Por qué Qwen 3.8 cambia la cuenta

Alibaba lleva dos años publicando versiones abiertas de Qwen, pero durante 2026 los modelos más potentes de la familia (los 3.7 Max y Plus) se quedaron cerrados, solo por API. Por eso el anuncio de agosto importa: Qwen3.8-Flash-Next sale con pesos abiertos, arquitectura MoE multimodal y sirve de adelanto de lo que será Qwen 4. Junto a él hay un Qwen 3.8 destilado de 27.000 millones de parámetros con licencia Apache 2.0, la más permisiva: se puede usar en un producto comercial sin pedir permiso ni compartir ingresos.

El tamaño es la clave. Un modelo de 27B cuantizado a 4 bits ocupa en torno a 16 GB de memoria de vídeo. Es decir, entra en una tarjeta gráfica de gama media de las que se venden en cualquier tienda de informática, no en una GPU de centro de datos de 30.000 euros. Y los modelos MoE, como el 35B-A3B de la generación 3.6, activan solo una parte de sus parámetros en cada respuesta, así que responden rápido incluso en hardware modesto.

Cómo lo usamos en Sozpic

En Sozpic solemos usar modelos Qwen para los agentes que se despliegan 24 horas. El ejemplo más claro son los que vigilan que las webs de nuestros clientes estén siempre bien: entran cada pocos minutos, comprueban que la página carga, que el formulario de contacto envía, que no hay enlaces rotos ni errores en el servidor, y avisan a una persona cuando algo se sale de lo normal. Son tareas repetitivas, con instrucciones claras y un resultado fácil de comprobar, y ahí un modelo abierto de 27B lo hace igual de bien que uno de pago.

El motivo es económico y práctico a la vez. Un agente que revisa veinte webs cada cinco minutos hace miles de comprobaciones al día, y cada una consume tokens. Con un modelo cerrado eso es una línea variable en la factura que crece con cada web que añades. Con IA local, la tarjeta se compra una vez y el coste marginal de cada comprobación es la luz que consume. Para una pyme de la Región de Murcia que no tiene a nadie mirando la web un domingo por la noche, esa diferencia decide si la vigilancia se hace o no.

Los casos donde no lo hacemos también cuentan. Cuando el agente tiene que razonar sobre documentos largos, redactar textos que van a leer clientes o tomar decisiones con matices, seguimos tirando de los modelos que lideran el ranking. Un buen despliegue combina ambos: el abierto para vigilar y repetir, el cerrado para lo delicado.

Los datos no salen de tu empresa

Hay una ventaja que muchas empresas valoran más que el ahorro. Con un modelo en local, el contenido de tu web, los datos de tus formularios o el historial de incidencias nunca abandonan tu servidor. No hay que revisar la política de retención de datos de un tercero ni firmar un acuerdo de encargado de tratamiento con una empresa de California.

Para las empresas que sí necesitan enviar documentos a una IA en la nube, hay una alternativa intermedia: anonimizarlos antes. Lo contamos en el artículo sobre anonimización de datos antes de la IA con micapa.ai. Las dos vías se complementan: lo que puede resolverse en local se resuelve en local, y lo que tiene que salir, sale limpio.

Lo que hace falta de verdad

Montar IA local no es instalar un programa y olvidarse. Estas son las piezas que decidimos con cada cliente antes de empezar:

  • La tarea. Un agente con un cometido concreto funciona; un asistente genérico que tiene que saber de todo, no. Vigilar una web, revisar precios o comprobar que un proceso terminó son trabajos acotados, y cuanto más acotados, mejor rinde un modelo pequeño.
  • La máquina. Una tarjeta de 16 GB sirve para varios agentes de vigilancia trabajando a la vez. Si el volumen crece mucho, hace falta más memoria o más tarjetas. Y el servidor tiene que estar encendido y vigilado las 24 horas, igual que el agente.
  • La conexión con tus sistemas. El agente vale poco si no puede abrir una incidencia, avisar por correo o dejar una nota en el sistema del equipo. Esa integración es lo que lleva tiempo, no el modelo.
  • La medición. Cuántas incidencias detecta, cuántas son falsas alarmas, cuánto tarda en avisar. Sin eso, no sabes si el agente funciona o solo parece que funciona.

Qué puedes hacer mañana

Si tienes una tarea repetitiva que hoy hace una persona cuando se acuerda o que simplemente no se hace fuera de horario, apúntala. Esa es la candidata a IA local. Calcula cuántas veces al mes habría que ejecutarla y compara lo que costaría en tokens con una tarjeta gráfica de gama media: en muchos casos la tarjeta se paga en el primer trimestre.

Y si prefieres verlo funcionando antes de decidir, en Sozpic tenemos agentes con Qwen vigilando webs ahora mismo. Cuéntanos qué proceso quieres cubrir y te decimos, con datos, si un modelo abierto en tu servidor da la talla o si conviene mezclar.