100% de parámetros por token
La ejecución densa activa todos los pesos en cada paso, aunque la entrada solo necesite una fracción.
Los modelos actuales ejecutan el 100% de sus parámetros para cada token, aunque la mayoría no aporte a esa predicción. Dispersion AI activa solo lo relevante — y construimos el compilador y el silicio para que eso sea posible.
El problema
La inferencia de modelos grandes es cara porque casi todo el cómputo se desperdicia: la mayoría de los parámetros no contribuyen a la predicción de cada token.
La ejecución densa activa todos los pesos en cada paso, aunque la entrada solo necesite una fracción.
Mover pesos que no aportan consume energía y ancho de banda sin mejorar la calidad.
La dependencia de memoria externa limita la eficiencia y encarece el hardware.
Arquitectura
Dispersion AI divide los parámetros del modelo en bloques y activa solo los relevantes para cada entrada. Una aproximación neuromórfica: alta capacidad total, baja activación por paso.
01
Cada token activa un subconjunto distinto de bloques según su contenido.
02
Sin expertos paralelos: la capacidad vive en un solo modelo, no en una mezcla.
03
La granularidad por bloques permite hardware eficiente sin sacrificar calidad.
04
El cerebro no activa todas sus neuronas para cada estímulo. Tampoco debería hacerlo un modelo.
Software
El compilador interno toma checkpoints de modelos abiertos, analiza sus pesos y los transforma en un formato binario optimizado para ejecución dispersa.
Modelos públicos como punto de partida.
El compilador estudia la estructura de esparcidad y relevancia de cada bloque.
Un artefacto .bin optimizado que desacopla el modelo del hardware y protege la IP.
Ejecución dispersa con el mismo golden reference, bit a bit.
Hardware
Las Unidades de Procesamiento de Dispersión (DPU) ejecutan Dispersion AI de forma nativa: menos memoria externa, menos energía desperdiciada y una ruta clara hacia eficiencias de órdenes de magnitud.
Los pesos inactivos no se mueven: el silicio solo accede a lo que se activa.
Sin tráfico de datos inútiles, el consumo cae con la actividad real.
Eficiencia estructural frente a hardware de propósito general.
Comparación
Tres formas de ejecutar un modelo grande, una sola con activación dinámica real.
| Denso | MoE | Dispersion AI | |
|---|---|---|---|
| Activación | 100% de parámetros | Expertos por token | Bloques relevantes por token |
| Modelo base | Único | Múltiples expertos | Único, con esparcidad interna |
| Hardware | GPU de propósito general | GPU con routing | Silicio dedicado (DPU) |
| Eficiencia | Baja por token | Media, con overhead de routing | Alta, activación real |
FAQ
No. La mayoría del hardware acelera matrices densas. Dispersion rediseña la relación modelo-máquina: el modelo se vuelve disperso por diseño y el silicio se construye alrededor de esa esparcidad.
No. El compilador transforma checkpoints abiertos existentes al formato interno sin reentrenar desde cero, preservando el comportamiento del modelo.
Investigación y desarrollo en curso: validación de modelos reales, integración compilador-runtime y simulación RTL. No es un producto comercial disponible.
El roadmap de 6 meses apunta a simulación RTL end-to-end y síntesis virtual antes de decidir fabricación o prototipado FPGA.
Inversores, partners e investigadores: hablemos.