发布时间:2025-10-28
点击次数: 蚂蚁百灵大模型团队近日正式推出了全新开源全模态大模型——ming-flash-omni-preview,标志着首个参数规模突破千亿的全模态模型正式向社区开放。该模型基于ling 2.0的稀疏moe架构构建,总参数量达103b,激活参数仅为9b,在保持高效推理的同时显著提升了多模态理解与生成能力。
相较于此前广受好评的Ming-lite-omni-1.5,新模型在图像、视频、语音等多个模态任务中实现了全面升级,尤其在可控图像生成、流式视频理解和高精度语音识别方面表现突出,整体性能位居当前开源全模态模型前列。


据团队介绍,Ming-flash-omni-Preview 在技术层面进行了多项关键优化,主要体现在以下三个方面:
1) 基于稀疏专家架构的全模态协同训练
本模型将Ling-flash-2.0所采用的稀疏MoE架构成功扩展至全模态场景,并沿用Ming-lite-omni提出的模态级路由机制,实现对不同模态数据分布和专家分配策略的精准建模,达成“大容量、小激活”的高效运行模式。通过在注意力层引入VideoRoPE(Video Rotary Position Embedding),增强了对长时视频内容的时空建模能力,显著提升视频交互理解水平。
在训练稳定性方面,团队采用了混合式专家负载均衡方案:
2)生成式分割与编辑一体化训练范式
在统一多模态系统中,如何深度融合图像的理解与生成能力是一大核心挑战。虽然Ming-lite-omni-1.5通过冻结语言通路并引入多尺度QueryToken注入层级化语义,在一定程度上实现了理解与生成的融合,但由于两类任务目标本质差异,诸如物体属性、空间关系等细粒度视觉知识仍难以有效迁移至生成端,限制了生成质量与控制精度。
为此,Ming-flash-omni-Preview创新性地提出 “生成式分割即编辑”(Generative Segmentation as Editing) 的协同训练框架。该方法将传统图像分割任务重构为语义保持型编辑指令,例如:“把香蕉涂成紫色”。这一设计的关键优势在于:
GoEnhance
全能AI视频制作平台:通过GoEnhance AI让视频创作变得比以往任何时候都更简单。
347
查看详情
实验表明,在GenEval基准测试中,Ming-flash-omni-Preview取得0.90分的成绩,超越所有非强化学习(non-RL)方法;在GEdit基准上的精准编辑任务(如物体删除、替换)平均得分从6.9跃升至7.9。这些成果验证了该范式不仅提升了编辑能力,还能有效泛化至自由文本驱动的图像生成任务。
3) 高效全模态训练架构设计
全模态基础模型的训练常面临两大瓶颈:数据异构性(各模态序列长度不一)与模型异构性(专用编码器结构差异导致并行困难),易引发负载不均、内存碎片和流水线气泡,严重影响训练效率。
针对上述问题,团队基于Megatron-LM框架实施了两项关键技术改进:
这些优化使得Ming-flash-omni-Preview的训练吞吐量相比基线系统提升近一倍,大幅缩短了大规模全模态模型的迭代周期。
目前,Ming-flash-omni-Preview 的完整模型权重与训练代码已全面开源,欢迎开发者与研究者使用:
GitHub: https://www.php.cn/link/eb901025f1ff4d8010f655b42a33210d
HuggingFace: https://www.php.cn/link/341c1d108df518a9ad0047345b7b641a
ModelScope: https://www.php.cn/link/fc815
a0b7bc84dce6b9c6f8ca4c28ad5
以上就是蚂蚁发布千亿参数开源全模态大模型 Ming-flash-omni-Preview的详细内容,更多请关注其它相关文章!
# github
# 嘉定区私人网站建设
# 沧州网站建设详细方案
# 黄山网站排名优化服务
# 广西网站建设公司外包
# 软文营销推广方案怎么写
# 权重优化的网站
# 淄博线上seo方案培训
# 专业网站优化教程
# 江苏seo软件案例
# 粤语
# 语音识别
# 多模
# 实现了
# 细粒度
# 重构
# 多个
# 负载均衡
# 开源
# 模态
# 大模型
# 路由
# ai
# 路由器
# 编码
# git
# 武威优化网站方法
相关栏目:
【
行业新闻62819 】
【
科技资讯67470 】
相关推荐:
乐天派AI桌面机器人提供的正能量情绪价值直接拉满,妥妥的治愈系
大疆 Air 3 无人机售价和实物照片曝光
利用AI探索抗体“钥匙”、加速药物研发——访百图生科团队
GPT-4不能在麻省理工学院获得计算机科学学位
前特斯拉总监、OpenAI大牛Karpathy:我被自动驾驶分了心,AI智能体才是未来!
华为余承东表示:鸿蒙可能拥有强大的人工智能大模型能力
WAIC 2025|云深处科技绝影Lite3与X20四足机器人亮相
“世界人工智能之都”的新烦恼:AI热潮无法拉动大量就业
网易云音乐和小冰推出AI歌手音乐创作软件,首发内置12名AI歌手
笔神作文声讨学而思AI大模型 称用“爬虫”技术盗取数据
加强能源消费绿色转型政策引导
Meta 推出 Quest 超级分辨率技术,让 VR 画面更清晰
大疆 DJI Mini 4 Pro 无人机曝光:流线设计,有望迎来功能性提升
传Meta 2025年推出首款AR眼镜,采用军用级别材料,计划生产1000台
2025年深圳举办的SUSECON 创新峰会开始接受报名
走进首家“元宇宙”未来工厂,卡奥斯探知工业之旅出发!
生成式人工智能来了,如何保护未成年人? | 社会科学报
当一个网站的内容被 AI 完全接管
2025年贵州省青少年机器人竞赛在安举行
人工智能即将进入Windows:企业准备好安全策略设置了吗?
成功孵化首个大型模型解决方案的重庆人工智能创新中心
“一般智力”与工艺学批判是认识AI的重要入口 | 社会科学报
央视报道!星纪魅族集团车载人机交互技术成世界移动通信大会焦点
「模仿学习」只会套话?解释微调+130亿参数Orca:推理能力打平ChatGPT
争鸣:OpenAI奥特曼、Hinton、杨立昆的AI观点到底有何不同?
鸿蒙4即将支持大规模AI模型
普渡机器人与变形金刚品牌合作,特别活动爆火,商品售罄!
人工智能自己玩自己
稿见AI助手:提升写作效率与质量的必备工具
探展WAIC | 第四范式“式说”聚焦toB大模型,布局生成式AI重构企业软件
美的推出 AI 双视精准避障的自动集尘扫拖机器人 V12,售价仅为2999元
科技赋能司法执行 阿里资产免费为全国法院升级VR新服务
基于预训练模型的金融事件分析及应用
MIT开发“PhotoGuard”技术保护图像免遭恶意AI编辑
人工智能助力林草行业高质量发展
如何利用AI工具写好本科论文:科技助你一臂之力
AMD称下半年AI显卡供应充足,不需要像NVIDIA那样加价抢购
亚马逊确认今年不会举办 re:MARS 机器人和人工智能大会
“世界上最像人的机器人”接入 Stable Diffusion ,现场完成作画
谷歌推出 AI 反洗钱工具,可将金融机构内部风险预警准确率提高2至4倍
小米创始人雷军将揭示小米AI在年度演讲中的最新进展
VMS的应用:提升多品牌设备管理效能
自己动手使用AI技术实现数字内容生产
腾讯企点客服接待与营销分析能力升级!企业操作更高效、人机交互更智能
苹果AR头显商标与华为撞车,在中国或改名
如何用Transformer BEV克服自动驾驶的极端情况?
为什么很多人对纽约《人工智能招聘法》感到生气?
【趋势周报】全球元宇宙产业发展趋势:ChatGPT的出现,将元宇宙实现至少提前了10年
1000万张照片训练AI模型 科学家找到水下定位新方法
国内阅读行业首款对话式AI应用“阅爱聊”封闭内测