415.tech
IA y tecnología, desde la primera línea de Silicon Valley
Inception lanza Mercury 2.5, un LLM de difusión a 1.107 tokens/seg con un contexto de 260K

Inception lanza Mercury 2.5, un LLM de difusión a 1.107 tokens/seg con un contexto de 260K

Inception lanzó Mercury 2.5, un modelo de lenguaje de difusión que alcanza 1.107 tokens por segundo en GPUs Nvidia ampliamente disponibles con un contexto de 260K tokens, con un precio de lista de $0.20 y $0.75 por millón de tokens de entrada y salida, con un descuento del 80% por lanzamiento. Las cifras en producción tienen más peso que la mejora de inteligencia del 40% declarada: Augment Code redujo la latencia de compactación de contexto en un 82%, de aproximadamente 150 segundos a 27, y el costo en un 90%, mientras que la respuesta de voz P99 de OpenCall cayó de varios minutos a aproximadamente un segundo. Los modelos de difusión ahora son lo suficientemente rápidos y económicos como para absorber las llamadas de soporte de alta frecuencia dentro de los agentes de búsqueda, voz y programación, donde la latencia por llamada se acumula.

Fuente: inceptionlabs.ai

Publicar en XCorreo
También en esta edición