Skip to content

🏷️ 多模态AI

共 15 篇文章

📄

腾讯开源OpenSearch-VL:打破多模态AI黑箱垄断,搜索智能体得分提升29%

腾讯混元团队联合UCLA、香港中文大学开源OpenSearch-VL多模态训练方案,将搜索智能体性能提升29%,提供完整开源方案打破AI技术黑箱,为多模态AI研究提供可复现的基础设施。

📄

讯飞智文Vision Agent实测:AI PPT从「抽卡」到「协作」,这次真不用返工了

讯飞智文Vision Agent实测:AI PPT从抽卡式升级为四步协作模式,每步可编辑打断。旅游攻略、品牌方案、学术汇报等多场景测试,基本不翻车,AI PPT进入商业级可用2.0阶段。

📄

Adobe Acrobat推PDF Spaces:静态文档秒变AI工作空间,可定制聊天机器人

Adobe在Acrobat中推出PDF Spaces功能,将静态PDF转化为交互式AI工作空间,支持AI生成摘要、演示文稿和定制聊天机器人,已在Acrobat Express上线。

🤖

AI内容生成工具新功能:多模态创作让灵感更容易实现

AI内容生成工具推出新功能,支持多模态创作。文字、图片、视频可以一站式生成。

🤖

AI视频生成技术新突破:生成的视频能有多逼真?

AI视频生成技术新突破,生成质量和时长都有提升。这是AI多模态能力的重要进展。

📄

DeepSeek那只「盲眼鲸鱼」终于开眼了:识图模式悄悄灰度,背后是个新模型

DeepSeek悄然上线「识图模式」,民间实测显示背后是独立视觉模型,不是简单集成OCR。V4发布5天后就补上多模态短板,节奏快得让社区意外,但也意味着技术可能还在打磨期。

🤖

OPPO小布记忆:截图、语音、文档混在一起,AI怎么帮你整理成「记忆」?

OPPO在AICon上海分享小布记忆技术方案,解决碎片化多模态内容到结构化记忆的整理难题。端云协同架构,80%简单场景端侧处理。关键数据:合集创建准确率83%→97%,新记忆加入76%→95%+。

🤖

多模态大模型都在比谁看得清,DeepSeek说真正的问题是「说不清楚」

DeepSeek发布多模态大模型技术报告,提出"基于视觉原语的思考"框架,以紧凑模型和低标记预算在空间推理上追平GPT-5.4、Claude-Sonnet-4.6等前沿模型。详见全文。

🤖

DeepSeek多模态技术报告:视觉原语让模型学会「指哪打哪」

DeepSeek发布多模态大模型技术报告,提出「视觉原语」框架,将点、边界框从视觉输入提升为「基本思维单元」,实现精确空间推演。小模型比肩GPT-5.4、Claude-Sonnet。

🤖

分层Agentic RAG解决企业「模态鸿沟」:30%传统RAG存在静默失败

InfoQ深度技术文章:分层Agentic RAG解决企业「模态鸿沟」,让结构化和非结构化数据同时被理解。内部评估显示30%传统RAG存在静默失败。Protocol-H引入supervisor-worker拓扑和自主纠错机制。

🤖

商汤开源U1:像素进、像素出,理解生成第一次合到一个网络里

商汤开源多模态统一架构模型SenseNova-U1,提出NEO-unify架构——像素进、像素出,理解生成首次合到一个网络里。在开源模型图像能力评测中登顶榜首,2048×2048图生图9秒出。

🤖

谷歌相册「长」出了穿搭助手:你的照片正在变成AI衣橱

谷歌相册将推出衣橱规划功能,用AI自动从相册中整理出服装图像,支持虚拟试穿和穿搭分享。先安卓后iOS,这是谷歌从「照片管理」向「AI生活助手」转型的最新动作。

📄

谷歌Vision Banana重磅发布:何恺明谢赛宁署名,图像生成器即通才视觉学习者

2026年4月26日谷歌发布Vision Banana重磅论文,何恺明谢赛宁署名,提出图像生成器即通才视觉学习者的新范式,颠覆视觉理解传统路径。

🤖

Claude Design 发布:Anthropic 杀进设计圈,一句话生成原型和幻灯片

2026年4月17日,Anthropic Labs 推出 Claude Design,一个对话驱动的 AI 设计工具,可将文本提示词转化为可交互原型、幻灯片、设计稿等视觉产出。

📄

MaxClaw:MiniMax推出的多模态AI助手,让创作无限可能

MiniMax推出MaxClaw多模态AI助手,基于OpenClaw和MiniMax大模型,专为内容创作设计,支持文本生成、图像创作、语音合成、视频生成等全模态能力。

探索 AI 世界,掌握智能未来