400 128 6709

行业新闻

CLIP当RNN用入选CVPR:无需训练即可分割无数概念|牛津大学&谷歌研究院

发布时间:2024-06-06点击次数:

循环调用clip,无需额外训练就有效分割无数概念。

包括电影动漫人物,地标,品牌,和普通类别在内的任意短语。

☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 免费无限量使用 DeepSeek R1 模型☜☜☜

CLIP当RNN用入选CVPR:无需训练即可分割无数概念|牛津大学&谷歌研究院

牛津大学与谷歌研究院联合团队的这项新成果,已被CVPR 2025接收,并开源了代码。

CLIP当RNN用入选CVPR:无需训练即可分割无数概念|牛津大学&谷歌研究院

团队提出名为CLIP as RNN(简称CaR)的新技术,解决了开放词汇量图像分割领域中的几个关键问题:

  • 无需训练数据:传统方法需要大量的掩膜注释或图像-文本数据集进行微调,CaR技术则无需任何额外的训练数据即可工作。
  • 开放词汇量的限制:预训练的视觉-语言模型(VLMs)在经过微调后,其处理开放词汇量的能力受到限制。CaR技术保留了VLMs的广泛词汇空间。
  • 对非图像中概念的文本查询处理:在没有微调的情况下,VLMs难以对图像中不存在的概念进行准确分割,CaR通过迭代过程逐步优化,提高了分割质量。

受RNN启发,循环调用CLIP

要理解CaR的原理,需要先回顾一下循环神经网络RNN。

RNN引入了隐藏状态(hidden state)的概念,就像是一个“记忆体”,存储了过去时间步的信息。而每个时间步共享同一组权重,可以很好地建模序列数据。

受RNN启发,CaR也设计成循环的框架,由两部分组成:

  • 掩膜提议生成器:借助CLIP为每个文本查询生成一个mask。
  • 掩膜分类器:再用一个CLIP模型,评估生成的每个mask和对应的文本查询的匹配度。如果匹配度低,就把那个文本查询剔除掉。

就这样反复迭代下去,文本查询会越来越精准,mask的质量也会越来越高。

最后当查询集合不再变化,就可以输出最终的分割结果了。

CLIP当RNN用入选CVPR:无需训练即可分割无数概念|牛津大学&谷歌研究院

之所以要设计这个递归框架,是为了最大限度地保留CLIP预训练的”知识”。

CLIP预训练中见过的概念可是海量,涵盖了从名人、地标到动漫角色等方方面面。如果在分割数据集上微调,词汇量势必会大幅缩水。

例如“分割一切”SAM模型就只能认出一瓶可口可乐,百事可乐是一瓶也不认了。

灵感PPT 灵感PPT

AI灵感PPT - 免费一键PPT生成工具

灵感PPT 308 查看详情 灵感PPT

CLIP当RNN用入选CVPR:无需训练即可分割无数概念|牛津大学&谷歌研究院

但是直接拿CLIP做分割,效果又不尽如人意。

这是因为CLIP的预训练目标本来就不是为密集预测设计的。尤其是当图像中不存在某些文本查询时,CLIP很容易生成一些错误的mask。

CaR巧妙地通过RNN式的迭代来解决这个问题。通过反复评估、筛选查询,同时完善mask,最终实现了高质量的开放词汇分割。

最后再来跟随团队的解读,了解一下CaR框架的细节。

CaR技术细节

CLIP当RNN用入选CVPR:无需训练即可分割无数概念|牛津大学&谷歌研究院

  • 循环神经网络框架:CaR采用了一个新颖的循环框架,通过迭代过程不断优化文本查询与图像之间的对应关系。
  • 两阶段分割器:由掩膜提议生成器和掩膜分类器组成,均基于预训练的CLIP模型构建,且权重在迭代过程中保持不变。
  • 掩膜提议生成:使用gradCAM技术,基于图像和文本特征的相似度得分来生成掩膜提议。
  • 视觉提示:应用如红圈、背景模糊等视觉提示,以增强模型对图像特定区域的关注。
  • 阈值函数:通过设置相似度阈值,筛选出与文本查询对齐程度高的掩膜提议。
  • 后处理:使用密集条件随机场(CRF)和可选的SAM模型进行掩膜细化。

通过这些技术手段,CaR技术在多个标准数据集上实现了显著的性能提升,超越了传统的零样本学习方法,并在与进行了大量数据微调的模型相比时也展现出了竞争力。如下表所示,尽管完全无需额外训练及微调,CaR在零样本语义分割的8个不同指标上表现出比之前在额外数据上进行微调过的方法更强的性能。

CLIP当RNN用入选CVPR:无需训练即可分割无数概念|牛津大学&谷歌研究院

作者还测试了CaR在零样本Refering segmentation的效果,CaR也表现出了相较之前零样本的方法表现出更强的性能。

CLIP当RNN用入选CVPR:无需训练即可分割无数概念|牛津大学&谷歌研究院

综上所述,CaR(CLIP as RNN)是一种创新的循环神经网络框架,能够在无需额外训练数据的情况下,有效地进行零样本语义和指代图像分割任务。它通过保留预训练视觉-语言模型的广泛词汇空间,并利用迭代过程不断优化文本查询与掩膜提议的对齐度,显著提升了分割质量。

CaR的优势在于其无需微调、处理复杂文本查询的能力和对视频领域的扩展性,为开放词汇量图像分割领域带来了突破性进展。

论文链接:https://arxiv.org/abs/2312.07661。
项目主页:https://torrvision.com/clip_as_rnn/。

以上就是CLIP当RNN用入选CVPR:无需训练即可分割无数概念|牛津大学&谷歌研究院的详细内容,更多请关注其它相关文章!


# 地标  # 安徽seo优化系统  # 北京外包网站优化  # 重工机械网站建设营销  # 农夫山泉软文营销推广  # seo帽子吴小姐  # 鞍山seo入门电话  # 绝版书网站 -推广  # 谷歌优化的网站  # 推广网站俯视云速捷独一  # 衡水网站网络推广哪家好  # 更强  # 神经网络  # 表现出  # 翻倍  # 出了  # 省电  # 迭代  # 掩膜  # 递归  # 牛津大学  # car技术  # clip 


相关栏目: 【 行业新闻62819 】 【 科技资讯67470


相关推荐: Databricks推出人工智能模型共享机制,可令开发者与公司“双赢”  英伟达H100霸榜权威AI性能测试 11分钟搞定基于GPT-3的大模型训练  AI框架生态峰会本周开幕 华为昇腾“朋友圈”再聚首 全球首个全模态大模型将登场  全国体育人工智能大会举办,专家聚焦体育人工智能领域人才培养  “无人驾驶船”将首次亮相世界人工智能大会,下半年或开进上海迪士尼  华为4G5G通信物联网收费标准公布,多年研发成果,十年花费近万亿  张朝阳与陆川谈AI:ChatGPT是鹦鹉学舌思维,不可能取代人类 | 把脉AI大模型  人工智能在商业中的风险和局限性  “三夏”农忙保障用电,无人机高空巡视高压线  能走、能飞、能游泳,科学家打造全能 M4 机器人  商业智能决策技术助力降本增效,世界人工智能大会举办商业AI高峰论坛  联通发布鸿湖图文AI大模型1.0,可实现以文生图  发布最新版本的 PICO OS 5.7.0:支持VR头盔录屏并跨平台分享至微信  可按用户语气自动回复消息,Zoom 推出基于生成式 AI 的新功能  2025智源大会AI安全话题备受关注,《人机对齐》新书首发  改动一行代码,PyTorch训练三倍提速,这些「高级技术」是关键  AI无法对传统文化符号进行解构和创新  OpenAI 已全面开放 GPT-3.5 Turbo、DALL-E 及 Whisper API  美图发布国内首个“懂美学的”AI视觉大模型MiracleVision  上海发布“元宇宙关键技术攻关行动方案”,加快 AIGC 等突破  探索人工智能在居家养老方面的应用  AI 模型 Stable Diffusion 升级:正常生成五指、图像更逼真  小岛秀夫不反对使用AI 但认为人类应该凌驾于AI  如何提高集群协作效率?中外团队合作研发基于均值偏移的机器人队形控制策略  为了避免人工智能可能带来的灾难,我们要向核安全学习  两架海燕号无人机交付中国气象局 助力建设国家级机动气象观测业务  Valve Index VR 头显销量下滑,上市四年的长青树渐失光彩  飒智智能机器人核心技术与应用论坛暨一体化控制器发布会成功举办  2025世界人工智能大会前沿科技共绘“未来”图景, 这家这家独角兽企业的通用大脑将在AI领域大放异彩  马斯克回应“人工智能让一切变得更好”:我们已经是半机器人了  彬州市第三届青少年机器人创新大赛成功举办  英特尔张宇:边缘计算在整个AI生态系统中扮演重要角色  新闻传闻:迪士尼可能采用人工智能来控制电影制作成本  应用生成式人工智能技术改善农业产业  张朝阳陆川谈AI:大数据模型大幅提升工作效率,ChatGPT冲击最大的是内容创作领域  Vision Pro 太贵,苹果基于 iPhone 的 VR 头显专利曝光  苹果2万5的AR遭遇砍单95%:不及预期  第四范式「式说」大模型入选《2025年通用人工智能创新应用案例集》  编程版GPT狂飙30星,AutoGPT危险了!  苹果AR头显商标与华为撞车,在中国或改名  “可用”“有用”的讯飞星火认知大模型将亮相世界人工智能大会  苹果式 AI 哲学:不着一字,处处落子  “木头姐”:特斯拉的人工智能训练——“赢家通吃”的机会  CharacterAI - 也许会成为会话人工智能的未来  日本学校探索引入 AI 和无人机:提高安保效率,节省劳动力  Meta 人工智能业务落后竞争对手,研究人员大量离职成重要原因  美图公司吴欣鸿:AI技术重构影像产业  解决导航“最后50米”难题 高德地图升级AR步行导航找终点功能  贫穷让我预训练  1分钟做出苹果Vision Pro「官网」?上班8小时搞出480个网页,同事被卷疯了 

400 128 6709
E-mail

contact@tlftec.cn

扫一扫,添加微信

©  云南淘乐房科技有限公司 版权所有  滇ICP备2025071560号  

云南淘乐房科技有限公司 云南淘乐房科技有限公司 云南淘乐房科技有限公司 云南淘乐房科技有限公司 云南淘乐房科技有限公司 云南淘乐房科技有限公司 云南淘乐房科技有限公司 云南淘乐房科技有限公司 云南淘乐房科技有限公司 云南淘乐房科技有限公司