La eficiencia se mide en la optimización del presupuesto operativo. Nosotros, en IT OESTE integramos la inteligencia artificial pero no como un gasto variable descontrolado, sino como un activo pero que sea estratégico, con un fin. Uno de nuestros puntos en que nos destacamos es en la implementación de context caching para las APIs de Gemini, una técnica que modifica la estructura de costes.
Te contamos sobre los desafíos y dificultades que se pueden tener, resultados y beneficios y para ello te explicamos sobre como lo hacemos en nuestro caso para que puedas tener una referencia👇🏼
En muchos de nuestros desarrollos internos y para clientes, trabajamos con grandes volúmenes de datos estáticos: bases de conocimiento legales, documentación técnica extensa o históricos de proyectos. Y antes cada consulta al modelo enviaba estos documentos una y otra vez… El problema era: pagar por procesar el mismo contenido miles de veces al día. Con ventanas de contexto que ahora superan el millón de tokens, el envío constante de información redundante estaba inflando nuestras facturas de Google Cloud innecesariamente.
El Context Caching nos permite “almacenar” una parte del contexto (el input) en la infraestructura de la API durante un tiempo determinado. En lugar de enviar 50.000 tokens en cada prompt, enviamos esos tokens una vez, los “cacheamos” y luego solo enviamos la pregunta específica del usuario.
Esta técnica es especialmente útil cuando:
👉🏼 El contexto es masivo (documentos de más de 32k tokens)
👉🏼 El mismo contexto se usa para múltiples consultas frecuentes
👉🏼 Buscamos reducir no solo el coste, sino también la latencia de respuesta
Implementamos esta solución en nuestra herramienta interna de auditoría de seguridad. El sistema analiza repositorios enteros para encontrar vulnerabilidades.
-Contexto fijo
El estándar de seguridad de la empresa, guías de estilo y documentación de arquitectura.
-Contexto Variable
El fragmento de código que el desarrollador está escribiendo en el momento
Antes, cada “guardar” del desarrollador disparaba una consulta completa. Ahora, el estándar de seguridad vive en el cache, y Gemini solo procesa los deltas de código.
Para lograr estos números, seguimos un flujo de trabajo técnico estricto que garantizara que el cache no caducara antes de tiempo pero que tampoco generara costes de almacenamiento innecesarios. ¿Cómo fue? de la siguiente manera:
Identificación de “hot context” – Analizamos qué documentos se repetían en el 80% de las peticiones de nuestra unidad de negocio
Determinación del TTL (time to live) – Configuramos el cache para que expire cada 1 hora. Si en esa hora hay actividad, el coste de mantenimiento se amortiza, si no, el cache se libera automáticamente
Implementación via SDK – Utilizamos el método cachedContent.create de la API de Gemini 1.5 Pro, pasando los documentos pesados como “metadata estática”
Inyección de la “cached content name” – En cada llamada posterior, en lugar de pasar el texto, pasamos el ID del cache generado en el paso anterior
Monitoreo de quotas – Configuramos alertas en Google Cloud Console para evitar que el almacenamiento de cache excediera nuestro presupuesto mensual de infraestructura
Ahorrar dinero es fundamental, pero nosotros valoramos la experiencia del usuario. Al usar Context Caching, el modelo no tiene que “leer” todo el documento desde cero cada vez. Esto reduce drásticamente el Time to First Token (TTFT).
Un sistema que antes tardaba 5 segundos en empezar a escribir, ahora lo hace en menos de uno. Esto nos ha permitido escalar el número de usuarios simultáneos sin degradar la calidad del servicio ni disparar los costes de infraestructura.
Usar IA por el simple hecho de usarla es un error de principiante. La verdadera ingeniería esta en la optimización. Gracias al Context Caching de Gemini, en IT OESTE hemos demostrado que es posible desplegar soluciones manteniendo una buena salud financiera impecable. La eficiencia económica es una meta y además es parte nuestra.
Más allá del ahorro directo en la factura de Google Cloud, la implementación de Context Caching en nuestro sistema de auditoría transformó la operatividad diaria de nuestros desarrolladores. Estas son las mejoras detectadas:
🟩 Reducción del “context switch” – Al ser las respuestas un 80% más rápidas, los desarrolladores no pierden el hilo de su lógica esperando la respuesta del auditor de IA.
🟩 Mayor profundidad de análisis – Como el coste por consulta bajó drásticamente, pudimos permitir que el sistema analice el código con prompts más complejos y detallados sin miedo a exceder el presupuesto.
🟩 Consistencia en las auditorías – Al usar siempre el mismo contexto cacheado, eliminamos las variaciones leves que a veces ocurren cuando se envía el contexto de formas distintas en cada sesión.
🟩 Escalabilidad sin fricción – Pasamos de pasar por 10 auditores simultáneos a más de 50 utilizando la misma cuota de tokens por minuto (TPM), optimizando el rendimiento del Tier de la API.
La implementación de Context Caching no es que fue solo una mejora técnica sino una decisión que al hacerla estratégicamente beneficio financieramente. En IT OESTE, logramos convertir una herramienta que empezaba a ser prohibitiva por su consumo de tokens en una solución altamente rentable y veloz.
El éxito de la IA en la empresa depende de quién sabe gestionar mejor el contexto. Al reducir nuestra dependencia del envío constante de datos repetitivos, no solo ahorramos costes, sino que liberamos recursos para innovar en nuevas funcionalidades que antes eran económicamente inviables.
Para nosotros la eficiencia económica es lo que nos permite seguir liderando el mercado de servicios IT con soluciones de IA que realmente escalan.
Si queres una asesoría gratuita y conocer mas sobre nosotros… 📲¡Hablemos HOY!📲
Este artículo fué escrito por humanos en nuestra Software Factory para la industria del software o personas que quieran conocer más sobre este mundo.
No, gracias.