Inicio Blog CV Nala Project
ES EN

Un modelo pequeño como primera parada

Ilustración: muchas líneas que convergen en un filtro naranja antes de llegar a un bloque oscuro, con el texto «Decidir antes de generar. Menos contexto. Menos espera.»

Con Laya y Jev me ha pasado algo que hacía tiempo que no me pasaba con un modelo. He pensado: esto es justo lo que estaba intentando conseguir.

En nuestro Gateway habíamos puesto Gemma 4 E2B como primera parada. Un modelo pequeño, con una tarea muy acotada: mirar la petición y ayudarnos a decidir qué hacer con ella antes de llamar a un modelo más grande. Si hacía falta o no llamar a uno más grande, o qué decisiones tomar.

Había bastante trabajo detrás. Teníamos que definir las opciones, explicar bien cuándo correspondía cada una y contemplar qué hacer con las consultas que no encajaban.

Lo que buscábamos era reducir las llamadas al LLM generativo. Que entrara cuando hiciera falta redactar, explicar o razonar sobre algo que lo mereciera. Para seleccionar una herramienta o decidir dónde buscar un dato, me costaba justificar que tuviera que leer todas las instrucciones y todo el catálogo de herramientas cada vez.

En una pyme esto es vital. El presupuesto es limitado, el equipo también y todo lo que añades luego hay que mantenerlo. Y, personalmente, lo que más me preocupa es la espera: puedes optimizar mucho el precio por token, pero si encadenas varias llamadas y el usuario sigue esperando, aún tienes un problema.

Por eso me interesa tanto la baja latencia de este tipo de modelos. Si la primera decisión es suficientemente rápida y acertada, puedes ahorrar trabajo después: recuperar solo la información necesaria, ofrecer al LLM menos herramientas y evitar contexto que no le aporta nada, que solo ralentiza las respuestas y amplía los tokens de entrada a procesar. También puedes introducir comprobaciones que ayuden con los guardrails, manteniendo los permisos y las autorizaciones en el código del Gateway.

Pero lo que más ganas tengo de explorar es el fine-tuning, que en Laya ya está disponible.

Me interesa poder entrenarlo con casos nuestros, revisados por las personas que conocen el trabajo. Qué entendemos nosotros por una petición urgente. Cuándo debe pasar a otro equipo. Qué información necesitamos antes de continuar. Qué excepciones requieren que alguien se pare a mirarlas. Además, al ser un modelo pequeño, es realmente viable hacerlo en la infraestructura de una pyme.

Esos criterios suelen estar repartidos entre procedimientos, la experiencia de unas pocas personas y documentación técnica dispersa por el ecosistema de la empresa. Poder recogerlos en ejemplos y comprobar si un modelo pequeño aprende a aplicarlos me parece especialmente valioso para una pyme. Claro que primero hay que ponerse de acuerdo en cuáles son: si nosotros resolvemos de forma distinta dos casos equivalentes, el entrenamiento no va a arreglarlo por arte de magia.

Además de los asistentes, veo posibilidades en aplicaciones donde una decisión tiene que llegar en milisegundos. Ahí habrá que medir el recorrido completo, porque la red y el resto de servicios también cuentan.

Todavía toca probar y ver dónde funciona bien y dónde falla. Que un modelo devuelva una opción válida no significa que haya elegido la correcta.

Aun así, hacía tiempo que una línea de trabajo no me encajaba tanto con lo que necesitaba. Si conseguimos adaptar estas decisiones a nuestros criterios y resolverlas con muy poca latencia, creo que vamos a poder hacer bastante más con los recursos que tenemos. Para muchas pymes, eso puede cambiar mucho las cosas.

#Inteligencia Artificial#Pymes#Laya#Jev#Fine-tuning#Agentes de IA#LLM#Arquitectura de Software#Automatización#IA Aplicada

Alex Sanz

Diseño productos y sistemas donde arquitectura, negocio e inteligencia artificial se convierten en capacidades reales, fiables y mantenibles.

Artículos relacionados

Ver todos
014 min

ADRs: memoria para humanos y contexto para agentes

Hace ya unos años, durante mi etapa en Santander Bank, empezamos a utilizar los Architecture Decision Records (ADR) para dejar constancia de determinadas decisiones arquitectónicas…

032 min

IA, responsabilidad y el modelo que estamos construyendo

La inteligencia artificial está avanzando a una velocidad enorme y creo que, como sociedad y como empresas, tenemos que hablar de ella con más calma, más responsabilidad y menos eu…