Multiverse Computing: cómo el unicornio español de computación cuántica comprime la IA

La compresión de modelos de lenguaje reduce a la mitad la memoria y puede duplicar la capacidad de las GPU, según el director comercial de la compañía. Intel y Qualcomm ya han llamado a su puerta para llevar la eficiencia a sus chips.

El cuello de botella de la IA ya no es entrenar, sino ejecutar los modelos sin que los costes se disparen. Multiverse Computing, unicornio español de computación cuántica, comprime los LLM y deja una lección para el deep tech.

La compañía vasca participa esta semana en el Encuentro de Economía Digital y Telecomunicaciones que AMETIC celebra en Santander hasta el 2 de septiembre. Su director comercial, Víctor Gaspar, ha explicado allí cómo una tecnología nacida en 2019 para acelerar modelos sencillos de machine learning se ha convertido en una palanca para el sector de los semiconductores.

Publicidad

Multiverse ya supera los 300 empleados y es una de las empresas que más patentes registra en España, según la propia compañía. Su entrada en el club de unicornios llegó después de una ronda de 500 millones de euros que confirmó su posición en el mapa deep tech europeo.

La ronda de 500 millones y la compresión que sedujo a los grandes del chip

El producto que están comprando los grandes no es hardware: es software que encoge modelos de inteligencia artificial. La empresa trabaja con redes tensoriales y técnicas de inspiración cuántica para reducir el tamaño de los grandes modelos de lenguaje (LLM), los mismos que mueven a ChatGPT o Claude, sin destrozar su precisión.

Gaspar lo resume con una cifra clave: como mínimo, pueden comprimir el modelo a la mitad. Eso reduce la memoria necesaria y, en un centro de datos con ocho GPUs, permite hacer el doble de trabajo sin añadir hardware, consumo energético ni refrigeración.

La eficiencia ya no es una opción de laboratorio: es la palanca que decide si una infraestructura de IA escala o se vuelve insostenible.

El origen fue casi accidental. Un cliente les preguntó si podían aplicar sus técnicas a los modelos de lenguaje que empezaban a aparecer. El equipo probó, y los resultados abrieron una línea de negocio que hoy interesa a Intel y Qualcomm.

Comprimir a la mitad: la métrica que importa a un centro de datos

Los modelos generativos se consumen por pago por uso. Es cómodo para prototipar, pero al pasar a miles de usuarios los costes se disparan. Multiverse comprime los modelos existentes —chinos, europeos o estadounidenses— para alojarlos internamente en la empresa, en la nube o en dispositivos, con menor coste.

Las compresiones habituales van del 50% al 80%, según datos de la compañía. En aplicaciones críticas, el margen no es solo económico: es seguridad.

📦 Caso de estudio: más imágenes por segundo para frenar antes

  • El reto: Un cliente del sector de automoción necesitaba detectar peatones con poca visibilidad combinando cámaras visibles e infrarrojas.
  • La jugada: Multiverse comprimió el modelo de visión por computador para reducir la latencia y pasar de 15 a 30 imágenes por segundo.
  • El resultado: El sistema puede reaccionar antes y ordenar el frenado con más antelación a 100 kilómetros por hora.
  • La lección: En deep tech, el valor no está solo en la precisión, sino en el tiempo de respuesta.

La explicación del director comercial es de sastre: el cliente dice qué quiere optimizar y para qué; ellos buscan la mejor combinación entre latencia, velocidad, precisión, memoria y capacidad de cómputo. La compresión elimina información redundante, no la esencial.

Intel y Qualcomm: el atajo de la eficiencia para pelear contra Nvidia

Nvidia domina el mercado de GPUs para inteligencia artificial, y rivales como Qualcomm, Intel, AMD o Huawei van por detrás en hardware. Para ellos, optimizar los modelos es una forma de sacar más partido a sus chips y de capturar mercado con modelos adaptados a cada arquitectura.

Los precios de DDR5 y HBM han subido, aumentar la potencia de los equipos es caro, y la compresión ayuda, aunque con un límite: siempre se elimina información. La clave de las redes tensoriales es identificar qué información es redundante y retirarla sin degradar el modelo de forma significativa.

Qué enseña Multiverse Computing a la España deep tech

Europa no va a ganar a Estados Unidos copiando sus mismas rondas de capital riesgo. El propio Gaspar lo admite: no tenemos las mismas cartas, y pretender jugar el juego estadounidense es perder. Su receta pasa por alianzas con terceros países, eficiencia energética y aprovechar la base científica para construir redes neuronales más eficientes.

Ese es el precedente que conecta con la asignatura pendiente del ecosistema español. La mayoría de los founders que levantan una ronda seed fracasa por intentar escalar sin un producto que el mercado ya demande. Multiverse no inventó la IA: escuchó a un cliente y aplicó una tecnología profunda a un dolor concreto, con métricas de ahorro difíciles de ignorar.

La lección para el emprendedor deep tech es doble: la diferenciación no se vende como investigación exótica, sino como una cuenta de resultados más ligera. Si puedes demostrar que reduces costes o duplicas capacidad, el cliente firma.

🚀 Hoja de Ruta para Emprender

  • Escucha al cliente antes de abrir nuevas líneas: La compresión de LLM nació de una pregunta concreta de un cliente, no de un roadmap cerrado.
  • Traduce la innovación a ahorro: Lleva siempre una métrica de coste, latencia o capacidad que el cliente pueda comparar con su situación actual.
  • Aplica lógica de fondo a tu sector: Si tu negocio tiene una ventaja técnica, busca un punto de dolor donde el cuello de botella sea el coste o la velocidad.
  • Construye patentes desde el primer día: Proteger el conocimiento profundo crea valor defensivo y atrae a socios industriales como Intel o Qualcomm.

Publicidad