用于学习对象级、语言感知和语义丰富视觉表征的GLIP模型-电子发烧友网

简介

问题

Visual recognition 模型通常只能预测一组固定的预先确定的目标类别，这限制了在现实世界的可扩展能力，因为对于新的视觉概念类别和新的任务领域需要新的标注数据。

CLIP可以在大量图像文本对上有效地学习 image-level 的视觉表征，因为大规模匹配的图像文本对包含的视觉概念比任何预定义的概念都更广泛，预训练的CLIP模型语义丰富，可以在 zero-shot 下轻松地迁移到下游的图像分类和文本图像检索任务中。

为了获得对图像的细粒度理解(如目标检测、分割、人体姿态估计、场景理解、动作识别、视觉语言理解)，这些任务都非常需要 object-level 的视觉表征。

方案

这篇论文提出了 grounded language-image pretraining (GLIP) 模型，用于学习对象级、语言感知和语义丰富的视觉表征。GLIP将 object detection 和 phrase grounding 结合起来进行预训练。这有两个好处：

GLIP可以同时从 detection 和 grounding 数据中训练学习，以改进两种任务，训练一个优秀的 grounding 模型；

GLIP可以通过 self-training 的方式生成 grounding boxes(即伪标签)来利用大量的图像文本对数据，使学习到的视觉表征具有丰富的语义。

实验上，作者对27M grounding data 进行预训练(包括3M人工注释和24M网络爬取的图像文本对)。训练学习到的视觉表征在各种目标级别的识别任务中都具有较强的zero/few shot迁移能力。

当直接在COCO和LVIS上评估(预训练期间没有训练COCO中的图像)时，GLIP分别达到 49.8 AP和 26.9 AP；

当在COCO上进行微调后，在val上达到 60.8 AP，在test-dev上达到 61.5 AP，超过了之前的SoTA模型。

主要贡献

「1、Unifying detection and grounding by reformulating object detection as phrase grounding」

改变了检测模型的输入：不仅输入图像，还输入 text prompt(包含检测任务的所有候选类别)。例如，COCO目标检测任务的 text prompt 是由80个COCO对象类别名组成的文本字符串，如图2(左)所示。通过将 object classification logits 替换为 word-region alignment 分数(例如视觉region和文本token的点积)，任何 object detection 模型都可以转换为 grounding 模型，如图2(右)所示。与仅在最后点积操作融合视觉和语言的CLIP不同，GLIP利用跨模态融合操作，具有了深度的跨模态融合的能力。

「2、Scaling up visual concepts with massive image-text data」

给定 grounding 模型(teacher)，可以自动生成大量图像-文本对数据的 grounding boxes 来扩充GLIP预训练数据，其中 noun phrases 由NLP解析器检测，图3为两个 boxes 的示例，teacher模型可以定位到困难的概念，如注射器、疫苗、美丽的加勒比海绿松石，甚至抽象的单词(视图)。在这种语义丰富的数据上训练可以生成语义丰富的student模型。

「3、Transfer learning with GLIP: one model for all」

GLIP可以有效的迁移到各种任务中，而只需要很少甚至不需要额外的人工标注。此外，当特定于任务的标注数据可用时，也不必微调整个模型，只需微调特定于任务的 prompt embedding，同时冻结模型参数。

利用VLM和MLLMs实现SLAM语义增强

语义同步定位与建图（SLAM）系统在对邻近的语义相似物体进行建图时面临困境，特别是在复杂的室内环境中。本文提出了一种面向对象SLAM的语义增强（SEO-SLAM）的新型SLAM系统，借

发表于 12-05 10:00 •170次阅读

利用VLM和MLLMs实现SLAM<b class='flag-5'>语义</b>增强

基于视觉语言模型的导航框架VLMnav

本文提出了一种将视觉语言模型（VLM）转换为端到端导航策略的具体框架。不依赖于感知、规划和控制之间的分离，而是使用VLM在一步中直接选择动作。惊讶的是，我们发现VLM可以作为一种无需任

发表于 11-22 09:42 •171次阅读

【《大语言模型应用指南》阅读体验】+ 基础知识学习

的信息，提供更全面的上下文理解。这使得模型能够更准确地理解复杂问题中的多个层面和隐含意义。 2. 语义分析模型通过训练学习到语言的

发表于 08-02 11:03

【《大语言模型应用指南》阅读体验】+ 俯瞰全书

上周收到《大语言模型应用指南》一书，非常高兴，但工作项目繁忙，今天才品鉴体验，感谢作者编写了一部内容丰富、理论应用相结合、印刷精美的著作，也感谢电子发烧友论坛提供了一个让我了解大语言

发表于 07-21 13:35

图像分割与语义分割中的CNN模型综述

图像分割与语义分割是计算机视觉领域的重要任务，旨在将图像划分为多个具有特定语义含义的区域或对象。卷积神经网络（CNN）作为深度学习的一种核心

发表于 07-09 11:51 •925次阅读

大语言模型：原理与工程时间+小白初识大语言模型

解锁我理解的是基于深度学习，需要训练各种数据知识最后生成自己的的语言理解和能力的交互模型。对于常说的RNN是处理短序列的数据时表现出色，耳真正厉害的是Transformer，此框架被推出后直接

发表于 05-12 23:57

【大语言模型：原理与工程实践】大语言模型的应用

设计提示词时，需要明确输出需求，以便得到满意的结果。推理引导如前文所述，提示工程对于训练大语言模型的逐步推理能力至关重要。零样本提示大语言模型展现了卓越的零样本

发表于 05-07 17:21

【大语言模型：原理与工程实践】大语言模型的评测

计算和代码纠错等。这些场景覆盖日常生活和学习的多个方面，使得对话能力评测变得尤为复杂和关键。为了全面评估大语言模型在各种应用场景下的对话能力，研究人员和使用者需要一套综合性的评测框架。该框架主要包括评测

发表于 05-07 17:12

【大语言模型：原理与工程实践】大语言模型的预训练

大语言模型的核心特点在于其庞大的参数量，这赋予了模型强大的学习容量，使其无需依赖微调即可适应各种下游任务，而更倾向于培养通用的处理能力。然而，随着学

发表于 05-07 17:10

【大语言模型：原理与工程实践】探索《大语言模型原理与工程实践》2.0

《大语言模型“原理与工程实践”》是关于大语言模型内在机理和应用实践的一次深入探索。作者不仅深入讨论了理论，还提供了丰富的实践案例，帮助读者理

发表于 05-07 10:30

【大语言模型：原理与工程实践】大语言模型的基础技术

的，与上下文语境无关，因此不适用于一词多义的情况。例如，“苹果”在“我去吃个苹果”与“这个苹果手机好用吗”这两个句子中的语义明显不同，但静态词向量语言模型仅利用同一个向量表示词的

发表于 05-05 12:17

【大语言模型：原理与工程实践】揭开大语言模型的面纱

维基百科、网页内容和书籍等，不仅掌握了语言的语法、语义和上下文信息，还能生成结构连贯、语义合理的句子和段落。大语言模型的一个显著特点是其庞大

发表于 05-04 23:55

【大语言模型：原理与工程实践】探索《大语言模型原理与工程实践》

的未来发展方向进行了展望，包括跨领域、跨模态和自动提示生成能力方向，为读者提供了对未来技术发展的深刻见解。《大语言模型原理与工程实践》是一本内容丰富、深入浅出的技术书籍。它不仅为读者提供了大语

发表于 04-30 15:35

浅析自动驾驶行业的视觉感知主流框架设计

视觉感知系统主要以摄像头作为传感器输入，经过一系列的计算和处理，对自车周围的环境信息做精确感知。目的在于为融合模块提供准确丰富的信息，包括被检测物体的类别、距离信息、速度信息、朝向信息

发表于 01-26 11:25 •689次阅读

一种基于表征工程的生成式语言大模型人类偏好对齐策略

最近复旦大学自然语言处理组郑骁庆和黄萱菁团队提出了基于表征工程（Representation Engineering）的生成式语言大模型人类偏好对齐方法RAHF（如图1所示），作为基于

发表于 01-03 14:25 •573次阅读

搜索历史

用于学习对象级、语言感知和语义丰富视觉表征的GLIP模型

评论

利用VLM和MLLMs实现SLAM语义增强

基于视觉语言模型的导航框架VLMnav

【《大语言模型应用指南》阅读体验】+ 基础知识学习

【《大语言模型应用指南》阅读体验】+ 俯瞰全书

图像分割与语义分割中的CNN模型综述

大语言模型：原理与工程时间+小白初识大语言模型

【大语言模型：原理与工程实践】大语言模型的应用

【大语言模型：原理与工程实践】大语言模型的评测

【大语言模型：原理与工程实践】大语言模型的预训练

【大语言模型：原理与工程实践】探索《大语言模型原理与工程实践》2.0

【大语言模型：原理与工程实践】大语言模型的基础技术

【大语言模型：原理与工程实践】揭开大语言模型的面纱

【大语言模型：原理与工程实践】探索《大语言模型原理与工程实践》

浅析自动驾驶行业的视觉感知主流框架设计

一种基于表征工程的生成式语言大模型人类偏好对齐策略