官方网站-首页官方网站-首页

“维修-保养-备件-检测-改造-优化-升级”一体化服务体系
您现在的位置:
首页
/
/
/
多模态通用感知能力超越 GPT-5,上海 AI 实验室开源书生・万象 3.5 大模型

多模态通用感知能力超越 GPT-5,上海 AI 实验室开源书生・万象 3.5 大模型

  • 分类:行业动态
  • 作者:
  • 来源:
  • 发布时间:2025-09-04 09:31:25
  • 访问量:350

【概要描述】【导(dǎo)语(yǔ)】9月(yuè)3日(rì),上(shàng)海(hǎi)人(rén)工(gōng)智(zhì)能(néng)实(shí)验(yàn)室(shì)宣(xuān)布(bù)开(kāi)源(yuán)通(tōng)用(yòng)多(duō)模(mó)态(tài)大(dà)模(mó)型(xíng)书(shū)生(shēng)・万(wàn)象(xiàng)3.5(InternVL3

多模态通用感知能力超越 GPT-5,上海 AI 实验室开源书生・万象 3.5 大模型

【概要描述】【导(dǎo)语(yǔ)】9月(yuè)3日(rì),上(shàng)海(hǎi)人(rén)工(gōng)智(zhì)能(néng)实(shí)验(yàn)室(shì)宣(xuān)布(bù)开(kāi)源(yuán)通(tōng)用(yòng)多(duō)模(mó)态(tài)大(dà)模(mó)型(xíng)书(shū)生(shēng)・万(wàn)象(xiàng)3.5(InternVL3

  • 分类:行业动态
  • 作者:
  • 来源:
  • 发布时间:2025-09-04 09:31:25
  • 访问量:350
详情

【导(dǎo)语(yǔ)】9月(yuè)3日(rì),上(shàng)海(hǎi)人(rén)工(gōng)智(zhì)能(néng)实(shí)验(yàn)室(shì)宣(xuān)布(bù)开(kāi)源(yuán)通(tōng)用(yòng)多(duō)模(mó)态(tài)大(dà)模(mó)型(xíng)书(shū)生(shēng)・万(wàn)象(xiàng)3.5(InternVL3.5),该(gāi)模(mó)型(xíng)在(zài)推(tuī)理(lǐ)能(néng)力(lì)、部(bù)署(shǔ)效(xiào)率(lǜ)与(yǔ)通(tōng)用(yòng)性(xìng)上(shàng)实(shí)现(xiàn)全面(miàn)升(shēng)级(jí)。InternVL3.5提(tí)供(gōng)9种(zhǒng)尺(chǐ)寸(cùn)模(mó)型(xíng),满(mǎn)足(zú)各(gè)场(chǎng)景(jǐng)需(xū)求(qiú),并(bìng)在(zài)多学科推理、多模态感知及文本能力上表现卓越,超越GPT-5等主流模型。此次升级重点强化了面向实际应用的智能体与文本思考能力,在GUI交互、具身空间推理和矢量图形处理等方面实现显著进步,为机器人自动化操作、物品识别与物理交互等领域带来革新。作为书生大模型体系的关键一环,InternVL3.5的全系列下载量已突破2300万次。

多模态通用感知能力超越 GPT-5,上海 AI 实验室开源书生・万象 3.5 大模型

  9 月 3 日消息,上海人工智能实验室(上海 AI 实验室)宣布开源通用多模态大模型书生・万象 3.5(InternVL3.5),其推理能力、部署效率与通用能力全面升级。

  InternVL3.5 本次开源有 9 种尺寸的模型,参数涵盖 10 亿-2410 亿,可满足各场景(jǐng)需(xū)求(qiú)。其(qí)中(zhōng),旗(qí)舰(jiàn)模(mó)型(xíng) InternVL3.5-241B-A28B 在(zài)多(duō)学(xué)科(kē)推(tuī)理(lǐ)基(jī)准(zhǔn) MMMU 中(zhōng)获(huò) 77.7 分(fēn),为(wèi)开(kāi)源(yuán)模(mó)型(xíng)中(zhōng)最(zuì)高(gāo)分(fēn);多(duō)模(mó)态(tài)通(tōng)用(yòng)感(gǎn)知(zhī)能(néng)力(lì)超(chāo)越(yuè) GPT-5,文本(běn)能(néng)力(lì)领(lǐng)跑(pǎo)主流(liú)开(kāi)源(yuán)多(duō)模(mó)态(tài)大(dà)模(mó)型(xíng)。

  与(yǔ) InternVL3.0 相(xiāng)比(bǐ),InternVL3.5 在(zài)图形用户界面(GUI)智能体、具身空间感知、矢量图像理解与生成等多种特色任务上实现显著提升。

  本次升级,上海 AI 实验室研究团队重点强化了 InternVL3.5 面向实际应用的智能体与文本思考能力,在 GUI 交互、具身空间推理和矢量图形处理等多个关键场景实现从“理解”到“行动”的跨越,并得到多项评测验证。

  GUI 交互部分,InternVL3.5 在 ScreenSpot-v2 元素定位任务以 92.9 分超越同类模型,同时支持 Windows / Ubuntu 自动化操作,并在 WindowsAgentArena 任务大幅领先 Claude-3.7-Sonnet。

  在具身智能体测试中,InternVL3.5 表现出理解物理空间关系并规划导航路径的能力,在 VSI-Bench 以 69.5 分超过 Gemini-2.5-Pro。

  在矢量图形理解与生成方面,InternVL3.5 在 SGP-Bench 以 70.7 分刷新开源纪录,生成任务 FID 值也优于 GPT-4o 和 Claude-3.7-Sonnet。

  具体来看,InternVL3.5 可跨 Windows、Mac、Ubuntu、Android等多个平台,识别界面元素并自主执行鼠标、键盘操作,实现恢复已删除文件、导出 PDF、邮件添加附件等任务的自动化。

  InternVL3.5 具备更强的 grounding 能力,可以泛化到全新的复杂大量小样本的具身场景,配合抓取算法,支持可泛化的长程物体抓取操作,助力机器人更高效地完成物品识别、路径规划与物理交互。

  作为上海 AI 实验室书生大模型体系的重要组成部分,InternVL 聚焦视觉模型技术,InternVL 全系列全网下载量已突破 2300 万次


扫二维码用手机看

CONTACT INFORMATION

联系方式

南京市栖霞区纬地路生命科技创新园

OFFICIAL ACCOUNTS

公众号

欢迎关注我们的官方公众号

二维码 - 南京科技有限公司

ONLINE MESSAGE

在线留言

留言应用名称:
客户留言
描述:
验证码

版权所有:南京科技有限公司     鲁ICP备17013760号       网站地图