Skip to content

🏷️ 多模态

共 20 篇文章

📄

DeepSeek V4开源引爆GitHub:用V4手搓Agent冲上热榜,多模态理解超越GPT-4o

DeepSeek V4开源引发GitHub热潮,开发者手搓AI Agent冲上热榜。V4多模态版本在视觉理解和代码生成方面超越GPT-4o,推理成本大幅降低。

📄

英伟达开源全模态模型:300亿参数搞定视频/音频/文本,吞吐量9倍

英伟达2026年4月28日开源全模态推理模型Nemotron 3 Nano Omni,300亿参数单模型通吃视频/音频/图像/文本。吞吐量是同类9倍,目前免费用。

📄

生数科技开源MotuBrain:国产统一多模态模型登顶开源榜首

生数科技开源MotuBrain统一多模态模型,在开源榜单登顶,逼近GPT-Image-2和Gemini 2.0 Flash-thinking,国产开源多模态大幅跃升。

📄

OPPO小布记忆揭秘:80%的AI处理在手机端完成,合集准确率97%

OPPO在AICon上海分享小布记忆技术实践:端云协同实现80%端侧推理,基于AndesVL多模态模型全模态理解碎片化内容。合集创建准确率从83%提升至97%,通过LLM-as-a-Judge自动评测。端侧推理优化策略涵盖Prompt精简和图片resize。

📄

商汤开源统一图像理解与生成模型U1:8B参数撑起GPT-Image-2级能力,还能边想边画

2026年4月30日,商汤开源SenseNova-U1模型。8B参数的NEO-unify架构统一图像理解与生成,无VE/VAE直接像素级交互。支持连续性图文创作、高密度信息图、思维链推理式编辑,8B版端侧可跑。配套Skills工具包已开源。

📄

小米MiMo-V2.5-Pro正式开源:4小时无中断模拟macOS,54个应用全开

2026年4月29日,小米正式开源MiMo-V2.5系列模型,涵盖Pro旗舰Agent、全模态基座、TTS、ASR四大模型。Pro版在Coding Agent和SWE-Bench Pro上逼近Claude Opus 4.6和GPT-5.4,能无中断4小时模拟完整macOS桌面系统运行54个应用。

📄

DeepSeek「开眼」引爆AI圈:12张刁钻图片试出能力边界

2026年4月30日,DeepSeek"开眼"多模态能力引爆AI圈,用12张刁钻图片试出能力边界,视觉理解能力突破。

📄

DeepSeek「开眼」引爆AI圈:多模态能力边界探索

2026年4月30日,DeepSeek「开眼」功能引爆AI圈,多模态能力突破,探索AI视觉能力边界。

📄

英伟达全模态大模型:几秒搞定老黄3分钟演讲,吞吐量同类9倍

2026年4月29日,英伟达发布全模态大模型,能在几秒内生成黄仁勋3分钟演讲,吞吐量是同类模型9倍。

📄

腾讯开源手机端离线翻译模型:仅0.4G支持33种语言

腾讯开源手机端离线翻译模型,模型大小仅0.4G,支持33种语言。在手机端即可实现多语言翻译,无需联网。

📄

小米MiMo-V2.5-Pro开源:全栈模型「孕育」出的macOS

小米开源MiMo-V2.5-Pro,双模型架构实现从代码生成到操作系统模拟的全栈能力。无需中断连续输出54个应用,浏览器真能冲浪。

📄

阿里HappyHorse视频模型开启灰测:720P低至0.44元/秒

4月27日,阿里ATH团队打造的HappyHorse 1.0视频生成模型开启灰测。支持文生视频、图生视频、多图参考视频及视频编辑功能,720P视频生成低至0.44元/秒,千问App首发支持15秒多镜头叙事,悟空等平台已首批接入。

📄

面壁MiniCPM-o 4.5发布技术报告:12GB显存全双工多模态,端侧AI交互来了

2026年4月28日面壁智能联合清华大学发布MiniCPM-o 4.5技术报告,公开Omni-Flow流式全模态框架。模型约9B参数,支持视频音频文本流输入,仅需12GB显存(RTX 5070)即可运行,HuggingFace下载量突破25万。

📄

阿里HappyHorse视频生成模型灰测:多模态竞争升温

2026-04-27消息,阿里视频生成模型HappyHorse 1.0开启灰测,多模态AI竞争升温,格局生变。

📄

灵光世界模型手机端上线:实时体验触手可及

2026年4月27日消息,灵光在手机端上线世界模型功能,实时体验触手可及,AI模拟技术进入消费级市场。

📄

Hugging Face开源新模型:挑战GPT-4V的多模态之王

2026年4月27日消息,Hugging Face开源新模型挑战GPT-4V的多模态之王地位,开源生态再次向前推进。

🤖

硬刚GPT-Image-2:国产AI生图天花板又被捅破了

国产AI生图模型硬刚GPT-Image-2,图像生成天花板再次被突破,多模态竞争加剧。

📄

何恺明Vision Banana论文:图像生成器就是通才视觉模型,生成即理解

2026年4月Google DeepMind发布Vision Banana,何恺明谢赛宁署名,证明图像生成模型经轻量指令微调可成为通才视觉模型,分割和深度估计任务超越专用模型SAM 3和Depth Anything 3。

📄

小米最强模型MiMo-V2.5开启公测:多模态能力再升级

小米发布迄今最强模型MiMo-V2.5系列并开启公测,多模态能力再升级。

📄

SenseClaw:商汤科技推出的视觉AI助手,让OpenClaw看懂世界

商汤科技推出SenseClaw视觉AI助手,基于OpenClaw和商汤日日新大模型,专为视觉理解场景设计,支持图像分析、视频理解、文档识别等视觉AI全能力。

探索 AI 世界,掌握智能未来