
Ejecuta Inteligencia Artificial Privada y Eficiente Sin la Nube. Este libro enseña a seleccionar, cuantizar y ejecutar modelos de lenguaje y visión en hardware local o dispositivos finales, garantizando máxima privacidad, baja latencia y cero costos de servidor.

Convierte el hardware disponible en un presupuesto técnico de memoria, cómputo y contexto antes de modificar el modelo.
Calcular una estimación útil de memoria para pesos y reservar margen para el estado de inferencia antes de elegir un modelo local.
Relacionar el tipo de acelerador disponible con el runtime y el patrón de inferencia que puede aprovecharlo.
Establecer una configuración de referencia de calidad, tamaño y rendimiento para atribuir correctamente el efecto de cada optimización.
Reduce la precisión de pesos y activaciones mediante una estrategia que preserve calidad medible.
Aplicar una estrategia INT8 distinguiendo pesos, activaciones y necesidad de calibración.
Evaluar cuantización INT4 de pesos para LLM y decidir si el ahorro de memoria justifica la degradación observada.
Elegir entre cuantización post-entrenamiento, entrenamiento consciente de cuantización y mantenimiento selectivo de operaciones en mayor precisión.
Reduce parámetros o transfiere conocimiento a modelos más pequeños sin confundir tamaño de archivo con velocidad real.
Distinguir poda no estructurada y estructurada y verificar si la sparsity produce beneficios reales en el runtime objetivo.
Aplicar el esquema teacher–student para transferir comportamiento útil a una arquitectura de menor costo.
Construir una secuencia de destilación, pruning y cuantización donde cada etapa tenga una hipótesis y medición separada.
Selecciona y configura runtimes modernos según formato de modelo, sistema operativo y acelerador disponible.
Desplegar un LLM cuantizado con llama.cpp y escoger un backend CPU/GPU compatible con el equipo.
Usar ONNX Runtime para desacoplar el formato del modelo del acelerador y validar la partición real del grafo.
Construir y medir un engine TensorRT usando precisión reducida y métricas reproducibles.
Desplegar y comprimir un modelo con OpenVINO/NNCF aprovechando el hardware Intel disponible.
Construye un protocolo reproducible para decidir entre modelos y configuraciones sin optimizar una sola métrica.
Ejecutar un benchmark reproducible que separe latencia individual, throughput y consumo de memoria.
Construir una evaluación que combine métricas técnicas con casos representativos del producto.
Comparar candidatos por tamaño, latencia y calidad identificando configuraciones dominadas y no dominadas.
Diseña pipelines locales que no dependan de la nube y valida que datos, modelos y procesamiento permanezcan en el dispositivo.
Convertir la inferencia on-device en una garantía verificable mediante un threat model y una prueba de cero conectividad.
Construir un pipeline de recuperación y generación donde documentos, índice, embeddings y LLM permanezcan en el dispositivo.
Seleccionar una ruta Apple o Android para ejecutar visión o audio en dispositivo con aceleración y recursos empaquetados.
Ensamblar modelo, compresión, runtime, benchmark y controles de privacidad en un artefacto que otra persona pueda reproducir.