- GenStorAIGE AI90 lleva la memoria AI más allá de las limitaciones tradicionales de GPU HBM mediante el uso de SSD
- El SSD PT200Z admite de manera eficiente actualizaciones constantes de la caché y al mismo tiempo exige cargas de trabajo predecibles
- Ocho GPU RTX 5090 logran una capacidad de memoria de inferencia efectiva dramáticamente mayor
GenStorAIGE presentó su plataforma de aceleración de inferencia AI90 en WAIC 2026, adoptando un enfoque centrado en el almacenamiento para expandir la capacidad efectiva de memoria de IA.
En lugar de depender únicamente de la memoria de gran ancho de banda de la GPU, la plataforma incorpora unidades de estado sólido PCIe Gen5 directamente en la jerarquía de memoria.
Esto permite que partes de la caché de valores-clave utilizadas por modelos de lenguaje grandes queden completamente fuera de la memoria de la GPU.
Último vídeo deTecnologíaRadar
SSD es una arquitectura de memoria de tres niveles basada en la descarga
El AI90 combina HBM, DRAM del sistema y SSD en una estructura de memoria unificada de tres niveles para manejar cargas de trabajo especulativas.
Al descargar de forma transparente los datos de la caché KV a los SSD, la plataforma reduce la presión de la memoria de la GPU y, al mismo tiempo, admite cargas de trabajo significativamente mayores y ventanas de contexto más largas.
Según GenStorAIGE, esta arquitectura reduce la latencia del primer token de segundos a tiempos de respuesta inferiores a segundos en configuraciones compatibles.
Esto representa una mejora de hasta 50 veces, así como una ganancia de rendimiento de hasta 5,1 veces y una reducción de aproximadamente un 39 % en el uso de memoria de la GPU.
Combinado con una comunicación GPU inteligente de igual a igual, la compañía dice que el AI90 puede acelerar la inferencia hasta 5,8 veces en sistemas con ocho tarjetas Nvidia GeForce RTX 5090.
Este multiplicador permite efectivamente que una configuración de ocho tarjetas se comporte cerca de un clúster de 46 GPU durante tareas de estimación persistentes.
La arquitectura también admite ventanas de contexto de más de 128.000 tokens, lo que permite el procesamiento de documentos de gran tamaño y el manejo de conversaciones sin agotar la memoria disponible.
El SSD PT200Z maneja demandas intensivas de escritura detrás del sistema
Para admitir cargas de trabajo de escritura continua creadas por actualizaciones continuas de caché KV, GenStorAIGE ha emparejado el AI90 con su nuevo SSD AI PT200Z.
Construida con flash pSLC NAND y conectada a través de una interfaz PCIe Gen5 x4, la unidad ofrece velocidades de lectura secuencial de hasta 14,8 GB/s.
El rendimiento de lectura aleatoria alcanza aproximadamente 3,1 millones de IOPS, mientras que la latencia de lectura se sitúa en sólo 54 microsegundos.
La latencia de escritura se reduce aún más a 10 microsegundos, lo que admite actualizaciones rápidas de caché de las que depende continuamente la arquitectura del AI90.
Las clasificaciones de resistencia alcanzan hasta 100 escrituras en unidades por día, una cifra adecuada para cargas de trabajo sostenidas de IA empresarial con migración constante de datos de caché.
Este diseño refleja el cambio más amplio hacia niveles de memoria en las infraestructuras de IA, a medida que los LLM superan cada vez más los límites prácticos de los HBM de GPU.
La integración de almacenamiento SSD extremadamente rápido en el proceso de inferencia ofrece un método para escalar la longitud del contexto sin requerir GPU adicionales o configuraciones grandes de HBM.
En esta etapa no se ha verificado realmente si las afirmaciones de rendimiento son válidas fuera de las condiciones de prueba controladas.
Como ocurre con la mayoría de los anuncios de proveedores, estas cifras de rendimiento provienen directamente de GenStorAIGE y aún requieren evaluaciones comparativas independientes en varias cargas de trabajo de IA del mundo real.
Vía Gurú del 3D
Siga TechRadar en Google News Y Agréganos como fuente preferida Recibe noticias, reseñas y opiniones de nuestros expertos en tu feed.