Dispersion AI

La inferencia, rediseñada.

Los modelos actuales ejecutan el 100% de sus parámetros para cada token, aunque la mayoría no aporte a esa predicción. Dispersion AI activa solo lo relevante — y construimos el compilador y el silicio para que eso sea posible.

El costo oculto de la inferencia densa.

La inferencia de modelos grandes es cara porque casi todo el cómputo se desperdicia: la mayoría de los parámetros no contribuyen a la predicción de cada token.

100% de parámetros por token

La ejecución densa activa todos los pesos en cada paso, aunque la entrada solo necesite una fracción.

Energía en datos inactivos

Mover pesos que no aportan consume energía y ancho de banda sin mejorar la calidad.

Memoria como cuello de botella

La dependencia de memoria externa limita la eficiencia y encarece el hardware.

Activación dinámica, no Mixture-of-Experts.

Dispersion AI divide los parámetros del modelo en bloques y activa solo los relevantes para cada entrada. Una aproximación neuromórfica: alta capacidad total, baja activación por paso.

01

Input-dependiente

Cada token activa un subconjunto distinto de bloques según su contenido.

02

Un único modelo base

Sin expertos paralelos: la capacidad vive en un solo modelo, no en una mezcla.

03

Esparcidad por bloques

La granularidad por bloques permite hardware eficiente sin sacrificar calidad.

04

Neuromórfico por diseño

El cerebro no activa todas sus neuronas para cada estímulo. Tampoco debería hacerlo un modelo.

Un compilador que entiende los pesos.

El compilador interno toma checkpoints de modelos abiertos, analiza sus pesos y los transforma en un formato binario optimizado para ejecución dispersa.

1

Checkpoint abierto

Modelos públicos como punto de partida.

2

Análisis de pesos

El compilador estudia la estructura de esparcidad y relevancia de cada bloque.

3

Formato binario propio

Un artefacto .bin optimizado que desacopla el modelo del hardware y protege la IP.

4

Runtime de inferencia

Ejecución dispersa con el mismo golden reference, bit a bit.

Silicio diseñado para la esparcidad.

Las Unidades de Procesamiento de Dispersión (DPU) ejecutan Dispersion AI de forma nativa: menos memoria externa, menos energía desperdiciada y una ruta clara hacia eficiencias de órdenes de magnitud.

Menos memoria externa

Los pesos inactivos no se mueven: el silicio solo accede a lo que se activa.

Menos energía

Sin tráfico de datos inútiles, el consumo cae con la actividad real.

Ruta a órdenes de magnitud

Eficiencia estructural frente a hardware de propósito general.

Denso vs MoE vs Dispersion AI.

Tres formas de ejecutar un modelo grande, una sola con activación dinámica real.

Denso MoE Dispersion AI
Activación 100% de parámetros Expertos por token Bloques relevantes por token
Modelo base Único Múltiples expertos Único, con esparcidad interna
Hardware GPU de propósito general GPU con routing Silicio dedicado (DPU)
Eficiencia Baja por token Media, con overhead de routing Alta, activación real

Preguntas frecuentes.

¿Es esto otro acelerador de IA?

No. La mayoría del hardware acelera matrices densas. Dispersion rediseña la relación modelo-máquina: el modelo se vuelve disperso por diseño y el silicio se construye alrededor de esa esparcidad.

¿Requiere reentrenar los modelos?

No. El compilador transforma checkpoints abiertos existentes al formato interno sin reentrenar desde cero, preservando el comportamiento del modelo.

¿Cuál es el estado actual?

Investigación y desarrollo en curso: validación de modelos reales, integración compilador-runtime y simulación RTL. No es un producto comercial disponible.

¿Cuándo habrá hardware físico?

El roadmap de 6 meses apunta a simulación RTL end-to-end y síntesis virtual antes de decidir fabricación o prototipado FPGA.

¿Quieres saber más?

Inversores, partners e investigadores: hablemos.