Chance AI 亮相 WAIC 2026:Chance Vision 1.5 以 86.9% 登顶 MMMU-Pro,刷新 SOTA

互联网
2026
07/20
09:39
分享
评论

2026 年 7 月 17 日至 20 日,世界人工智能大会(WAIC 2026)在上海举行。视觉智能公司 Chance AI 在大会期间发布新一代视觉推理智能 Chance Vision 1.5。它在高难度多模态理解与推理基准 MMMU-Pro 官方公开榜单中取得 86.9% 的综合准确率,位列全球第一,达到该基准的 SOTA。(*SOTA 是 State of the Art 的缩写,通常用来指模型在特定公开基准或任务上的当前最佳水平。)与此同时,Chance AI 将模型放入 WAIC 的高密度真实场景中,让观众通过一张现场照片完成展商识别、信息理解、要点提炼与后续探索。

1|Chance AI 亮相 WAIC 2026,将视觉推理能力带入真实展会环境

图2|巴西人工智能协会(ABRIA)代表到访 Chance AI 展位

在 WAIC,把一次拍摄变成对现场信息的理解

上千家展商、密集的产品演示和专业术语同时出现,观众往往拍了大量照片,离开展位后却很难想起“这家公司是谁、产品解决什么问题、为什么值得关注”。传统搜索还要求用户先看清名称、组织关键词,再跳转到多个页面寻找答案。

Chance AI 在 WAIC 现场把这条路径压缩到一次拍摄。会前,用户可以根据 Agent、硬科技、机器人和初创项目等方向选择路线;进入展馆后,只需拍下展位、展板或设备,Chance AI 就会从画面中识别展商与产品,补全团队、技术和产品背景,提炼值得关注的要点,并整理成可以继续追问、收藏与分享的结构化笔记。

例如,当观众对准一台陌生机器人时,Chance AI 不只给出“这是一台人形机器人”的标签,还会继续理解现场展板、设备形态与上下文,说明它由谁开发、正在展示什么能力、与同类产品相比有哪些关注点。用户不必先知道应该问什么,摄像头本身就是理解现场的入口。

图3|观众使用 Chance AI 识别现场信息,并生成可以继续探索的结果

86.9% 登顶 MMMU-Pro,Chance Vision 1.5 达到 SOTA

Chance Vision 1.5 是支撑现场体验的技术底座,在 MMMU-Pro 官方公开榜单中取得 86.9% 的综合准确率,高于 人类专家的 85.4%、GPT-5.4 Thinking w/ tools 的 82.1% 和 Gemini 3.0 Pro 的 81.0%,位列第一。

MMMU-Pro 并不是普通的拍照识物测试,它覆盖工程图、地图、图表、化学结构等专业视觉材料,并通过删除不依赖图片即可作答的问题、增加干扰选项以及引入 Vision-only 设置,重点考察模型能否真正结合视觉信息、专业知识与复杂推理完成任务。

Chance Vision 1.5 的能力不只适用于展会中的物体和展商识别,也能够处理结构复杂、信息密集且需要专业知识参与的视觉问题。WAIC 现场展示则把这套高难度视觉推理能力转化为普通用户可直接体验的交互:无需预先组织问题,只需将摄像头对准眼前事物,AI 就能从画面和上下文出发继续理解。

图4|Chance Vision 1.5 在 MMMU-Pro 视觉推理评测中取得 86.9% 综合准确率

从“看懂”到“行动”,Chance AI 公布 Visual Agent 的记忆

Chance AI 在发布 Chance Vision 1.5 的同时,公开论文《Memory-Conditioned Tool Calling for Camera-First Visual Agents》,首次系统披露个人记忆如何参与 Visual Agent 的工具选择与行动决策。研究发现,记忆并非在答案生成后附加一句“根据你的喜好”,而是会提前影响 Agent 调用什么工具、使用什么查询词、检索到什么深度,以及何时停止。

研究团队使用 800 张真实场景图片与受控构造的个人记忆,在视觉输入、基础模型和可用工具保持一致的条件下进行对照实验。移除三层个人记忆后,工具查询相关性从 4.21 降至 3.74,相对下降 11.2%;端到端任务效用从 0.842 降至 0.760,相对下降 9.7%。实验表明,即使面对同一张图片,不同用户真正需要的信息和下一步行动也可能完全不同。

例如,面对同一台机器人,行业从业者可能关注技术路线与供应链,投资人关注团队和商业化进展,普通观众则更想知道它能做什么。个人记忆的作用,是让 Visual Agent 不只识别眼前的对象,还能判断哪些信息与当前用户真正相关。

Chance AI 联合创始人兼 CTO 吴晓凡表示:“榜单验证的是 AI 能不能看懂复杂画面,真正的产品问题是,看懂之后它该查什么、为什么查,以及如何帮助用户完成下一步。视觉让 AI 看见世界,记忆让它理解眼前的人。”

图5|现场展示 Visual Agent 从视觉感知、实时推理到场景理解的多层能力

下一代方向:让摄像头成为 AI 理解现实世界的入口

从 Chance Vision 1.5 到个人视觉记忆,再到工具调用与多步执行,Chance AI 正在搭建一套完整的 Camera-First Visual Agent 技术路径:视觉模型负责理解复杂画面,记忆系统判断什么与用户相关,Agent 则将理解转化为查询、判断与行动。

目前,Chance AI App 是这套技术面向生活场景的第一阶段载体,覆盖旅行、消费、收藏、审美与生活问答等需求。截至目前,产品总用户数达 30 万,近 30 天 MAU 约 9 万,月安装量约 3.5 万;美国及 Tier 1 市场用户约占 MAU 的 40%—46%。

下一阶段,Chance AI 将把复杂视觉理解、行业知识推理和 Agent 流程编排能力延伸至视觉信息密集的生产力工具与垂直行业,让商品图片、设备照片、工程图、表单、视频和现场画面直接进入理解、查询、判断与后续工作流。长期来看,这套能力还将进入机器人、智能眼镜、可穿戴设备及其他智能硬件,使 AI 能够通过摄像头感知现实世界、理解人的意图,并在获得授权后参与真实行动。

关于 Chance AI

Chance AI 成立于 2025 年,致力于打造以摄像头为入口的 Camera-First Visual Agent。在旧金山、东京和深圳设有办公室。产品以相机为入口,通过复杂视觉理解、个人上下文、工具调用与多步推理,帮助用户从一张图片出发,获得与自己相关、可以继续行动的答案。2026 年 5 月,Chance AI 完成由美图领投的数百万美元融资,并在视觉理解基准测试 MMMU-PRO 上排名世界第一。

关于吴晓凡

吴晓凡,Chance AI 联合创始人兼 CTO,负责公司视觉智能、Agent 系统与产品技术架构,研究方向包括复杂视觉推理、个人视觉记忆与 Camera-First Visual Agent。他是论文《Memory-Conditioned Tool Calling for Camera-First Visual Agents》的第一作者及通讯作者。

THE END
广告、内容合作请点击这里 寻求合作
免责声明:本文系转载,版权归原作者所有;旨在传递信息,不代表砍柴网的观点和立场。

相关热点

相关推荐

1
3