设置
  • 日夜间
    随系统
    浅色
    深色
  • 主题色

上海交大新框架解锁CLIP长文本能力,多模态生成细节拿捏,图像检索能力显著提升

2024-04-01 14:23:53 来源: 量子位

即插即用V3K流量资讯——探索最新科技、每天知道多一点LLSUM.COM

CLIP长文本能力被解锁,图像检索任务表现显著提升!V3K流量资讯——探索最新科技、每天知道多一点LLSUM.COM

一些关键细节也能被捕捉到。上海交大联合上海AI实验室提出新框架Long-CLIPV3K流量资讯——探索最新科技、每天知道多一点LLSUM.COM

上海交大新框架解锁CLIP长文本能力,多模态生成细节拿捏,图像检索能力显著提升

△棕色文本为区分两张图的关键细节V3K流量资讯——探索最新科技、每天知道多一点LLSUM.COM

Long-CLIP在保持CLIP原始特征空间的基础上,在图像生成等下游任务中即插即用,实现长文本细粒度图像生成——V3K流量资讯——探索最新科技、每天知道多一点LLSUM.COM

长文本-图像检索提升20%,短文本-图像检索提升6%。V3K流量资讯——探索最新科技、每天知道多一点LLSUM.COM

解锁CLIP长文本能力

CLIP对齐了视觉与文本模态,拥有强大的zero-shot泛化能力。因此,CLIP被广泛应用在各种多模态任务中,如图像分类、文本图像检索、图像生成等。V3K流量资讯——探索最新科技、每天知道多一点LLSUM.COM

但CLIP的一大弊病是在于长文本能力的缺失V3K流量资讯——探索最新科技、每天知道多一点LLSUM.COM

首先,由于采用了绝对位置编码,CLIP的文本输入长度被限制在了77个token。不仅如此,实验发现CLIP真正的有效长度甚至不足20个token,远远不足以表征细粒度信息。V3K流量资讯——探索最新科技、每天知道多一点LLSUM.COM

文本端的长文本缺失也限制了视觉端的能力。由于仅包含短文本,CLIP的视觉编码器也只会提取一张图片中最主要的成分,而忽略了各种细节。这对跨模态检索等细粒度任务是十分不利的。V3K流量资讯——探索最新科技、每天知道多一点LLSUM.COM

同时,长文本的缺乏也使CLIP采取了类似bag-of-feature(BOF)的简单建模方式,不具备因果推理等复杂能力。V3K流量资讯——探索最新科技、每天知道多一点LLSUM.COM

针对这一问题,研究人员提出了Long-CLIP模型。V3K流量资讯——探索最新科技、每天知道多一点LLSUM.COM

上海交大新框架解锁CLIP长文本能力,多模态生成细节拿捏,图像检索能力显著提升

具体提出了两大策略:保留知识的位置编码扩充(Knowledge-Preserving Stretching of Positional Embedding)与加入核心成分对齐(Primary Component Matching)的微调策略。V3K流量资讯——探索最新科技、每天知道多一点LLSUM.COM

保留知识的位置编码扩充

一个简单的扩充输入长度、增强长文本能力的方法是先以固定的比率 λ1 对位置编码进行插值,再通过长文本进行微调。V3K流量资讯——探索最新科技、每天知道多一点LLSUM.COM

研究者们发现,CLIP的不同位置编码的训练程度是不同的。由于训练文本很可能以短文本为主,较低位的位置编码训练较为充分,能够精确地表征绝对位置,而较高位的位置编码则仅能表征其大致的相对位置。因此,对不同位置的编码进行插值的代价是不同的。V3K流量资讯——探索最新科技、每天知道多一点LLSUM.COM

基于以上观察,研究者保留了前20个位置编码,而对于剩下的57个位置编码,则以一个更大的比率λ2 进行插值,计算公式可表示为:V3K流量资讯——探索最新科技、每天知道多一点LLSUM.COM

上海交大新框架解锁CLIP长文本能力,多模态生成细节拿捏,图像检索能力显著提升

实验表明,相较于直接插值,该策略可以在支持更长的总长度的同时大幅提升在各个任务上的性能。V3K流量资讯——探索最新科技、每天知道多一点LLSUM.COM

加入核心属性对齐的微调

仅仅引入长文本微调会使模型走入另一个误区,即一视同仁地囊括所有细节。针对这一问题,研究者们在微调中引入核心属性对齐这一策略。V3K流量资讯——探索最新科技、每天知道多一点LLSUM.COM

具体而言,研究者们利用主成分分析(PCA)算法,从细粒度的图像特征中提取核心属性,将其余属性过滤后重建粗粒度图像特征,并将其与概括性的短文本进行对齐。这一策略既要求模型不仅能够包含更多的细节(细粒度对齐),同时还能识别并建模其中最为核心的属性(核心成分提取与粗粒度对齐)。V3K流量资讯——探索最新科技、每天知道多一点LLSUM.COM

上海交大新框架解锁CLIP长文本能力,多模态生成细节拿捏,图像检索能力显著提升

△加入核心属性对齐的微调流程V3K流量资讯——探索最新科技、每天知道多一点LLSUM.COM

即插即用在各种多模态任务中

在图文检索、图像生成等领域,Long-CLIP可即插即用地替换CLIP。V3K流量资讯——探索最新科技、每天知道多一点LLSUM.COM

比如图文检索,Long-CLIP能够在图像与文本模态捕捉更多细粒度信息,从而可以增强相似图像和文本的区分能力,大幅提升图文检索的表现。V3K流量资讯——探索最新科技、每天知道多一点LLSUM.COM

无论是在传统的短文本检索(COCO、Flickr30k),还是在长文本检索任务上,Long-CLIP在召回率上均有显著提升。V3K流量资讯——探索最新科技、每天知道多一点LLSUM.COM

上海交大新框架解锁CLIP长文本能力,多模态生成细节拿捏,图像检索能力显著提升

△短文本-图像检索实验结果V3K流量资讯——探索最新科技、每天知道多一点LLSUM.COM

上海交大新框架解锁CLIP长文本能力,多模态生成细节拿捏,图像检索能力显著提升

△长文本-图像检索实验结果V3K流量资讯——探索最新科技、每天知道多一点LLSUM.COM

上海交大新框架解锁CLIP长文本能力,多模态生成细节拿捏,图像检索能力显著提升

△长文本-图像检索可视化,棕色文本为区分两张图片的关键细节

除此之外,CLIP的文本编码器常被用于文本到图像生成模型中,如stable diffusion系列等。但由于长文本能力的缺失,用于生成图像的文本描述通常都十分简短,无法个性化地订制各种细节。V3K流量资讯——探索最新科技、每天知道多一点LLSUM.COM

Long-CLIP可以突破77个token的限制,实现篇章级别的图像生成(右下)。V3K流量资讯——探索最新科技、每天知道多一点LLSUM.COM

也可以在77个token内建模更多地细节,实现细粒度图像生成(右上)。V3K流量资讯——探索最新科技、每天知道多一点LLSUM.COM

上海交大新框架解锁CLIP长文本能力,多模态生成细节拿捏,图像检索能力显著提升

论文链接:V3K流量资讯——探索最新科技、每天知道多一点LLSUM.COM
https://arxiv.org/abs/2403.15378V3K流量资讯——探索最新科技、每天知道多一点LLSUM.COM
代码链接:V3K流量资讯——探索最新科技、每天知道多一点LLSUM.COM
https://github.com/beichenzbc/Long-CLIPV3K流量资讯——探索最新科技、每天知道多一点LLSUM.COM

本文链接:上海交大新框架解锁CLIP长文本能力,多模态生成细节拿捏,图像检索能力显著提升http://www.llsum.com/show-2-4431-0.html

声明:本网页内容由互联网博主自发贡献,不代表本站观点,本站不承担任何法律责任。天上不会到馅饼,请大家谨防诈骗!若有侵权等问题请及时与本网联系,我们将在第一时间删除处理。

上一篇: 百亿tokens免费额度,清华系明星AI公司的羊毛薅起来

下一篇: 一款手游有400+个AI角色!腾讯游戏新系统炸场GDC:训练成本大减90%

热门资讯

  • 站在“人工智能+”探索前列

    今年全国两会期间,人工智能成为热点话题,“人工智能+”首次被写入政府工作报告。一头连着数字经济发展大局,一头连着行业变革与创新,“人工智能+”既是

  • 全国首个模拟验证机场开工

    记者日前获悉,位于四川成都未来科技城应用性科创区的民航科技创新示范区(B区)航站楼项目,近日取得施工许可证。这也意味着全国首个模拟验证机场开工。

  • 人类祖先200万年前开始捕鱼

    美国《发现》杂志网站2月7日刊登题为《200万年前,我们的人类祖先开始从水里捞鱼》的文章,作者是科迪·科蒂尔,内容编译如下:捕鱼可能是一种占许

  • 睡不够很焦虑?专家:警惕常见睡眠认知误区

    3月21日是世界睡眠日,今年中国主题为“健康睡眠 人人共享”。人的一生约有三分之一的时间是在睡眠中度过,睡眠、运动、营养被视为保障机体正常发育和

  • 我科学家实现最小资源消耗的量子态分辨

    记者3月20日从中国科学技术大学获悉,该校郭光灿院士团队在量子态分辨研究中取得重要进展。研究组在最小资源消耗的量子态分辨问题中首次提出了全局

  • “爆”脾气电池频“发火”,新成果防患于未“燃”

    近年来,电动自行车以便利性受到大众青睐,但相关起火事故威胁着居民的生命财产安全。据国家消防救援局发布的统计数据,2023年全国共接报电动自行车火灾

  • 我国建立“天-空-地-深”一体化铀矿勘查技术体系

    记者3月21日从核工业北京地质研究院(以下简称核地研院)获悉,该院自1959年成立以来,在天然铀保障、高放废物地质处置、核遥感技术与应用、分析测试等领

  • “认知选择”或影响人类语言演化

    人类的语言自产生以来,就不断演化发展。发音、词汇、语法的演变过程,是语言学家较为关注的领域。语言演化的根本动力是什么,演化又呈现出怎样的规律?我

  • AI、死亡与机器人:“数字生命”背后的生意与争议

    21世纪经济报道记者 冯恋阁 王俊 广州、北京报道2013年播出的科幻电视剧《黑镜》第二季中有这样一个故事——女主角玛莎在男友艾什被车祸

  • 京东与OPPO重磅合作:销售额3年翻倍!

    3月23日消息,京东与OPPO战略合作协议签约仪式举行,双方签订未来三年OPPO在京东全渠道实现销售额同比增长100%的目标。在签约仪式上,OPPO高级副CEO、首席产

  • “捕风捉光”,气象服务助力新能源发电

    今年3月23日是第64个世界气象日,主题是“气候行动最前线”。面对愈加频繁的极端天气和全球变暖等气候危机,减缓气候变化已刻不容缓。发展新能源是应

  • “穿上就走”的通用外骨骼面世

    美国佐治亚理工学院机械工程师开发了一种控制机器人外骨骼的通用方法。无需专门训练、特别校准,对复杂算法进行调整后,用户穿上外骨骼就可以直接行走

推荐资讯

  • 日榜
  • 周榜
  • 月榜