Appearance
共 20 篇文章
DeepSeek V4开源引发GitHub热潮,开发者手搓AI Agent冲上热榜。V4多模态版本在视觉理解和代码生成方面超越GPT-4o,推理成本大幅降低。
英伟达2026年4月28日开源全模态推理模型Nemotron 3 Nano Omni,300亿参数单模型通吃视频/音频/图像/文本。吞吐量是同类9倍,目前免费用。
生数科技开源MotuBrain统一多模态模型,在开源榜单登顶,逼近GPT-Image-2和Gemini 2.0 Flash-thinking,国产开源多模态大幅跃升。
OPPO在AICon上海分享小布记忆技术实践:端云协同实现80%端侧推理,基于AndesVL多模态模型全模态理解碎片化内容。合集创建准确率从83%提升至97%,通过LLM-as-a-Judge自动评测。端侧推理优化策略涵盖Prompt精简和图片resize。
2026年4月30日,商汤开源SenseNova-U1模型。8B参数的NEO-unify架构统一图像理解与生成,无VE/VAE直接像素级交互。支持连续性图文创作、高密度信息图、思维链推理式编辑,8B版端侧可跑。配套Skills工具包已开源。
2026年4月29日,小米正式开源MiMo-V2.5系列模型,涵盖Pro旗舰Agent、全模态基座、TTS、ASR四大模型。Pro版在Coding Agent和SWE-Bench Pro上逼近Claude Opus 4.6和GPT-5.4,能无中断4小时模拟完整macOS桌面系统运行54个应用。
2026年4月30日,DeepSeek"开眼"多模态能力引爆AI圈,用12张刁钻图片试出能力边界,视觉理解能力突破。
2026年4月30日,DeepSeek「开眼」功能引爆AI圈,多模态能力突破,探索AI视觉能力边界。
2026年4月29日,英伟达发布全模态大模型,能在几秒内生成黄仁勋3分钟演讲,吞吐量是同类模型9倍。
腾讯开源手机端离线翻译模型,模型大小仅0.4G,支持33种语言。在手机端即可实现多语言翻译,无需联网。
小米开源MiMo-V2.5-Pro,双模型架构实现从代码生成到操作系统模拟的全栈能力。无需中断连续输出54个应用,浏览器真能冲浪。
4月27日,阿里ATH团队打造的HappyHorse 1.0视频生成模型开启灰测。支持文生视频、图生视频、多图参考视频及视频编辑功能,720P视频生成低至0.44元/秒,千问App首发支持15秒多镜头叙事,悟空等平台已首批接入。
2026年4月28日面壁智能联合清华大学发布MiniCPM-o 4.5技术报告,公开Omni-Flow流式全模态框架。模型约9B参数,支持视频音频文本流输入,仅需12GB显存(RTX 5070)即可运行,HuggingFace下载量突破25万。
2026-04-27消息,阿里视频生成模型HappyHorse 1.0开启灰测,多模态AI竞争升温,格局生变。
2026年4月27日消息,灵光在手机端上线世界模型功能,实时体验触手可及,AI模拟技术进入消费级市场。
2026年4月27日消息,Hugging Face开源新模型挑战GPT-4V的多模态之王地位,开源生态再次向前推进。
国产AI生图模型硬刚GPT-Image-2,图像生成天花板再次被突破,多模态竞争加剧。
2026年4月Google DeepMind发布Vision Banana,何恺明谢赛宁署名,证明图像生成模型经轻量指令微调可成为通才视觉模型,分割和深度估计任务超越专用模型SAM 3和Depth Anything 3。
小米发布迄今最强模型MiMo-V2.5系列并开启公测,多模态能力再升级。
商汤科技推出SenseClaw视觉AI助手,基于OpenClaw和商汤日日新大模型,专为视觉理解场景设计,支持图像分析、视频理解、文档识别等视觉AI全能力。