发布时间:2023-06-27
点击次数: 多模态机器学习在各种场景下都取得了令人瞩目的进展。然而,多模态学习模型的可靠性尚缺乏深入研究。「信息是消除的不确定性」,多模态机器学习的初衷与这是一致的——增加的模态可以使得预测更为准确和可靠。然而,最近发表于 ICML2025 的论文《Calibrating Multimodal Learning》发现当前多模态学习方法违法了这一可靠性假设,并做出了详细分析和矫正。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 免费无限量使用 DeepSeek R1 模型☜☜☜
图片
当前的多模态分类方法存在不可靠的置信度,即当部分模态被移除时,模型可能产生更高的置信度,违反了信息论中 「信息是消除的不确定性」这一基本原理。针对此问题,本文提出校准多
模态学习(Calibrating Multimodal Learning)方法。该方法可以部署到不同的多模态学习范式中,提升多模态学习模型的合理性和可信性。
图片
该工作指出,当前多模态学习方法存在不可靠的预测置信度问题,现有多模态机器学习模型倾向于依赖部分模态来估计置信度。特别地,研究发现,当前模型估计的置信度在某些模态被损坏时反而会增加。为了解决这个不合理问题,作者提出了一个直观的多模态学习原则:当移除模态时,模型预测置信度不应增加。但是,当前的模型却倾向于相信部分模态,容易受到这个模态的影响,而不是公平地考虑所有模态。这进一步影响了模型的鲁棒性,即当某些模态被损坏时,模型很容易受到影响。

为了解决上述问题,目前一些方法采用了现有的不确定性校准方法,例如 Temperature Scaling 或贝叶斯学习方法。这些方法可以构建比传统训练 / 推理方式更准确的置信度估计。但是,这些方法只是使最终融合结果的信心估计与正确率匹配,并没有明确考虑模态信息量与信心之间的关系,因此,无法本质上提升多模态学习模型的可信性。
作者提出了一个新的正则化技术,称为 “Calibrating Multimodal Learning (CML)”。该技术通过添加一项惩罚项来强制模型预测信心与信息量的匹配关系,以实现预测置信度和信息量之间的一致性。该技术基于一种自然的直觉,即当移除一个模态时,预测置信度应该降低(至少不应该增加),这可以内在地提高置信度校准。具体来说,提出了一种简单的正则化项,通过对那些当移除一个模态时预测置信度会增加的样本添加惩罚,来强制模型学习直观的次序关系:


上面的约束为正则损失,当模态信息移除信心上升时作为惩罚出现。
实验结果表明,CML 正则化可以显著提高现有多模态学习方法的预测置信度的可靠性。此外,CML 还可以提高分类精度,并提高模型的鲁棒性。

多模态机器学习在各种情境中取得了显著的进展,但是多模态机器学习模型的可靠性仍然是一个需要解决的问题。本文通过广泛的实证研究发现,当前多模态分类方法存在预测置信度不可靠的问题,违反了信息论原则。针对这一问题,研究人员提出了 CML 正则化技术,该技术可以灵活地部署到现有的模型,并在置信度校准、分类精度和模型鲁棒性方面提高性能。相信这个新技术将在未来的多模态学习中发挥重要作用,提高机器学习的可靠性和实用性。
以上就是基于信息论的校准技术,CML让多模态机器学习更可靠的详细内容,更多请关注其它相关文章!
# 机器学习
# 自助网站建设的好处
# 中国
# 上海
# 不可靠
# 丰田
# 中国科学院
# 这一
# 移除
# 提出了
# 模态
# 多模
# 模型
# 陕西seo软件有哪些
# 杭州网站优化推荐哪里有
# 惠州网站seo服务保障
# seo不良信息屏蔽
# 小程序营销宣传推广方式
# seo网站优化是否已经过时
# 苏州seo推广人员
# 网站推广的思路
# 南宁seo首页优化招聘
相关栏目:
【
行业新闻62819 】
【
科技资讯67470 】
相关推荐:
阿里云全面支持Llama2训练部署,助力企业快速构建自有大型模型
人工智能驱动艺术,打开达利的超现实想象
腾讯自主研发机器狗 Max 升级,可“奔跑跳跃”完成避障动作
Xreal AR 眼镜用投屏盒子 Beam 发布:分体式设计,到手 699 元
映宇宙数字人“映映”亮相ChinaJoy,展示AI黑科技实现用户互动
AI拉动PCB发展|行业发现
GPT-4最全攻略来袭!OpenAI官方发布,六个月攒下来的使用经验都在里面了
剧透!蜜小豆@2025世界人工智能大会多个亮点曝光
有远见!华为四年前注册商标Vision Pro:苹果AR国内要改名
Bing 聊天机器人现支持在桌面端用语音提问
“无人驾驶船”将首次亮相世界人工智能大会,下半年或开进上海迪士尼
曝光HarmonyOS 4的重要新能力:全面升级AI大模型,小艺实现全面进化
MetaGPT AI 模型开源:可模拟软件公司开发过程,生成高质量代码
自研4D激光雷达L1 + GPT大语言模型 宇树Unitree Go2四足机器人有啥黑科技?
扎克伯格吐槽苹果Vision Pro:社交落后Meta太多,无法建设元宇宙
报道称亚马逊正在测试AI生成产品评价摘要
对Hugging Face开源模型精准投毒!LLM切脑后变身PoisonGPT,用虚假事实洗脑60亿人
亚马逊确认今年不举办re:MARS人工智能大会
360°/180°双模式,佳能公布可折叠小体积的VR全景相机
世界人工智能大会(WAIC 2025)点燃魔都,博尔捷数字科技携前沿技术产品亮相
AI时代,企业需要什么样的员工?
全新“AI助手”!讯飞星火助手中心人机协作共创新生态
央视报道车载人机交互技术!MWC上海魅族表现亮眼,现场热火朝天
李开复:未来几年,人工智能会革了所有人的命,除非你这么做
人工智能的变革之路:通过OpenAI的GPT-4漫游
编程已死,AI 当立?教授公开“唱反调”:AI 还帮不了程序员
科技有狠活|时光修复师 :用AI让昨日重现
一图速览 | 十大脑机接口关键技术发布
AI连线 | 专访风平智能CEO林洪祥:让AI数字人拥有漂亮的外表和有趣的灵魂,安全问题是重要考量
“踩油门,也要会踩刹车” 互联网企业高管谈人工智能发展
聚焦WAIC|AI技术支撑大模型探索未来
数据科学,解码智能未来——Altair首次提出“Frictionless AI”概念
京东 AI 大模型官宣 7 月 13 日发布,还有重磅合作
SnapFusion技术大幅提升AI图像生成速度
金山办公宣布与英伟达团队合作,加速WPS AI服务
美的推出 AI 双视精准避障的自动集尘扫拖机器人 V12,售价仅为2999元
Win11 的画图应用将包含 Windows Copilot 的 AI 工具整合
美图设计室2.0什么时候上线
生成式AI与云结合,机遇与挑战并存
用AI技术点亮老照片:Deep Nostalgia带给照片新生动感
“图壤·阅读元宇宙”亮相北京国际图书博览会
马斯克发推讽刺人工智能:机器学习的本质就是统计
海柔创新携手SAP,以机器人技术助力全球客户升级数智化竞争力
AI无法对传统文化符号进行解构和创新
Meta开源文本生成音乐大模型,我们用《七里香》歌词试了下
首届全国体育人工智能大会在首都体育学院召开
马斯克称人类是半机器人,记忆外包给了电脑
AI工具助力公司实施每周4.5天工作制,带来巨大效益
Meta发布"类人"AI图像创建模型,能解决多出手指等Bug
AI创作广告文案等同2.47年工作经验,且消费者无法区分|AI营销前沿