
Inception 发布 Mercury 2.5:支持 260K 上下文的 diffusion LLM,速度达 1,107 tokens/sec
Inception 发布了 diffusion 语言模型 Mercury 2.5,在广泛使用的 Nvidia GPU 上实现了 1,107 tokens/sec 的速度与 260K token 上下文。其输入和输出定价分别为每百万 token $0.20 和 $0.75,首发期提供 80% 折扣。相比官方宣称的 40% 智能提升,实际生产数据更具说服力:Augment Code 将上下文压缩延迟降低了 82%(从约 150 秒降至 27 秒),成本降低 90%;而 OpenCall 的 P99 语音响应时间从数分钟骤降至约 1 秒。Diffusion 模型如今已足够快速且廉价,足以处理搜索、语音和编程 agent 内部的高频辅助调用,解决单次调用延迟不断叠加的问题。
来源: inceptionlabs.ai ↗