
2026 WAIC 芯展速张江馆展区
7月17日,2026世界人工智能大会(WAIC)在上海开幕。芯展速在张江展区三展位及世博论坛同步亮相,正式发布 AI90 —— FaaS(Flash as a Service) for AI 架构,引发业内广泛关注。
芯展速许玮世博演讲:算力狂奔 存储掉队?

芯展速产品VP-许玮 于 2026 WAIC发表重要内容
芯展速产品副总裁许玮在演讲中指出:近二十年 GPU 算力提升约60,000倍,而显存容量仅增长16倍、带宽仅增长30倍,算存严重失衡导致主流 GPU 有效算力利用率仅30% - 60%。

2026 WAIC 芯展速张江馆展区
而芯展速本次发布的 AI90 架构,通过将 KV Cache 从 HBM 卸载至高性能 SSD,构建 HBM + DRAM + SSD 三级存储体系,智能 P2P 互联技术优化了 GPU 间数据通路,跨卡数据传输时无须CPU 和主机内存搬运,实现 GPU 间高效直连。让消费级 GPU 也能高效承载大模型推理,释放 token 效能。
AI 90 架构实测:性能跃升5倍,延迟骤降50倍
在芯展速张江展区,工作站现场运行搭载消费级 GPU 与 AI90 SSD 的推理系统,直观展示「用消费级显卡跑大模型」的技术突破。

在 Llama 3 70B 模型推理场景下:
• 4卡5090集群搭配 AI90 方案,吞吐量从约 120 tk/s 跃升至 6 10 tk/s,提升5.1倍。
• 首 Token 延迟在 64K 上下文下从27.99秒降至0.564秒,提升近50倍。
• 显存利用率从30% - 40%提升至85% - 95%,提升2 - 3倍。
同步发布的支撑该方案的核心硬件 PT200Z AI SSD 采用 PCIe Gen5 接口与 pSLC 介质,DWPD 最高达100,专为 KV Cache 高频写入场景优化。
媒体专访:AI90以「存算协同」重构推理路径
芯展速产品副总 - 裁许玮强调,AI 推理正从短上下文向长上下文、多轮对话加速演进,KV Cache 已成为核心瓶颈。「AI90 的本质,是把存储变成算力的放大器。」

芯展速产品VP 许玮 接受媒体采访
“Token 经济的本质,是谁的单位 Token 成本更低,谁就能赢。” 许玮以这句话结束演讲,“芯展速的目标,就是让每一块钱的算力投资,产出更多的Token。”
演讲完毕,现场掌声雷动。会后钛媒体、DOIT 等媒体对芯展速技术团队就 AI90 的部署场景、兼容性及落地路径对许玮及芯展速团队进行了深度专访。
结语
WAIC 2026 上芯展速 AI90 的亮相,不仅验证了消费级GPU跑大模型的工程可行性,更标志着 AI 推理从「算力独大」逐步走向「存算并重」。
当行业仍在为 HBM 的稀缺产能支付溢价时,芯展速 AI90 解决方案借助高效能的 AI SSD 存储平抑算力成本;这正是 Token经济时代,打破显存瓶颈的破局路径。
