为你推荐

书名页
内容提要
版权页
作者简介
前言
第1章视觉任务的视觉语言模型综述
1.1 视觉语言模型摘要
1.2 视觉语言模型问题提出
1.3 视觉语言模型背景
1.3.1 视觉识别的训练范式
1.3.2 用于视觉识别的VLM的开发
1.3.3 相关调查
1.4 VLM基础
1.4.1 网络架构
1.4.2 VLM预训练目标
1.4.3 VLM预训练框架
1.4.4 评估设置和下游任务
1.5 数据集
1.5.1 预训练VLM的数据集
1.5.2 VLM评估数据集
1.6 视觉语言模型预训练
1.6.1 具有对抗目标的VLM预训练
1.6.2 具有生成目标的VLM预训练
1.6.3 带有对齐目标的VLM预训练
1.7 VLM迁移学习
1.7.1 迁移学习的动机
1.7.2 迁移学习的常见设置
1.7.3 常见的迁移学习方法
1.8 视觉大模型语言知识提炼
1.8.1 从VLM中提取知识的动机
1.8.2 常识提炼方法
1.9 性能比较
1.9.1 VLM预训练的表现
1.9.2 VLM迁移学习的性能
1.9.3 VLM知识提取的性能
1.10 未来发展方向
1.11 小结
第2章视觉语言模型各种示例
2.1 通过模仿和自我监督学习创建多模态交互代理
2.2 DEPT:用于参数高效微调的分解式快速调谐
2.3 基于聚类掩蔽的高效视觉语言预训练
2.4 来自并行文本世界的LLM训练的体现多模态智能体
2.5 在丰富的监督下加强视觉语言预训练
2.6 FairCLIP:在视觉和语言学习中强调公平
2.7 用于开放式目标检测的生成区域语言预训练
2.8 FROSTER:冻结的CLIP是开放词汇动作识别的有力教师
2.9 Ins-DetCLIP:对齐检测模型以遵循人类语言指令
2.10 MMICL:通过多模态语境学习增强视觉语言模型的能力
2.11 学习提示分割任何模型
2.12 NEMESIS:视觉语言模型软性向量的归一化
2.13 非自回归序列到序列视觉语言模型
2.14 一个提示词足以提高预训练视觉语言模型的对抗鲁棒性
2.15 连续学习的快速梯度投影
2.16 检索增强对比视觉文本模型
2.17 TCP:基于文本的类感知可视化语言模型的提示调优
2.18 联合学习中视觉语言模型的文本驱动提示生成
第3章大视觉语言模型的少数样本任务适配
3.1 少数样本任务适配概述
3.2 少数样本任务适配相关知识
3.2.1 少数样本任务适配历史渊源
3.2.2 相关工作概述
3.3 少数样本任务适配准备工作
3.3.1 对比视觉语言预训练大规模VLM
3.3.2 可迁移性
3.3.3 使用适配器进行高效迁移学习
3.3.4 现有少样本任务ETL方法的陷阱
3.4 少样本任务拟议办法
3.4.1 重新审视线性探测
3.4.2 约束线性探测
3.4.3 线性探测的类自适应约束
3.5 少样本任务实验
3.5.1 安装程序
3.5.2 少样本任务测试结果
3.5.3 少样本任务消融实验
3.6 少样本任务限制
第4章基于锚点的视觉语言模型鲁棒微调
4.1 锚点视觉语言模型鲁棒微调概要
4.2 锚点视觉语言模型鲁棒微调相关技术
4.2.1 锚点视觉语言模型鲁棒微调问题提出
4.2.2 锚点视觉语言模型鲁棒微调相关工作
4.3 锚点视觉语言模型鲁棒微调准备工作
4.3.1 符号摘要
4.3.2 对比视觉语言模型
4.4 锚点视觉语言模型鲁棒微调方法
4.4.1 问题设置
4.4.2 基于锚点的稳健微调概述
4.5 锚点视觉语言模型鲁棒微调实验
4.5.1 域转换下的评估
4.5.2 零样本学习下的评价
4.5.3 消融研究
4.5.4 锚的定性示例
4.6 小结
第5章视觉语言模型的一致性引导快速学习
5.1 一致性引导快速学习摘要
5.2 一致性引导快速学习问题提出及相关工作
5.2.1 一致性引导快速学习问题提出
5.2.2 一致性引导快速学习相关工作
5.3 一致性引导快速学习方法
5.3.1 准备工作
5.3.2 协同学习:以一致性为导向的快速学习
5.4 一致性引导快速学习4个实验
5.4.1 实验设置
5.4.2 新概括的基础
5.4.3 跨数据集评估
5.4.4 域泛化
5.4.5 消融研究
5.4.6 参数和计算复杂度
5.5 小结
第6章InternVL:扩展视觉基础模型并对齐通用视觉语言任务
6.1 InternVL扩展视觉基础模型并对齐摘要
6.2 扩展视觉基础模型并对齐问题提出及相关工作
6.2.1 扩展视觉基础模型并对齐问题提出
6.2.2 扩展视觉基础模型并对齐相关工作
6.3 扩展视觉基础模型并对齐拟议方法
6.3.1 总体架构
6.3.2 模型设计
6.3.3 对齐策略
6.4 扩展视觉基础模型并对齐实验
6.4.1 实施细节
6.4.2 视觉感知基准
6.4.3 视觉语言基准
6.4.4 多模式对话基准
6.4.5 消融研究
6.5 扩展视觉基础模型并对齐结论
6.6 扩展视觉基础模型并对齐补充材料
6.6.1 更多实验
6.6.2 更多消融研究
6.6.3 详细训练设置
6.6.4 预训练数据准备
6.6.5 SFT的数据准备
第7章提高大型视觉语言模型组合性的迭代学习
7.1 迭代学习摘要
7.2 迭代学习问题提出及相关工作
7.2.1 迭代学习问题提出
7.2.2 迭代学习相关工作
7.3 迭代学习方法
7.3.1 将视觉语言对抗学习重构为刘易斯信号博弈
7.3.2 用于规范表示的共享码本
7.3.3 训练中的迭代学习
7.4 迭代学习实验
7.4.1 实验设置
7.4.2 迭代学习提高了组合性
7.4.3 迭代学习不会损害识别
7.4.4 迭代学习分析
7.4.5 消融研究
7.5 小结
第8章MATCHER:使用通用特征匹配一次性分割任何内容
8.1 特征匹配一次性分割摘要
8.2 特征匹配一次性分割问题提出及相关工作
8.2.1 特征匹配一次性分割问题提出
8.2.2 特征匹配一次性分割相关工作
8.3 特征匹配一次性分割方法
8.3.1 对应矩阵提取
8.3.2 提示生成
8.3.3 可控掩模生成
8.4 特征匹配一次性分割实验
8.4.1 实验设置
8.4.2 少样本点语义分割
8.4.3 单样本任务物体部分分割
8.4.4 视频对象分割
8.4.5 消融研究
8.4.6 定性结果
8.5 小结
第9章视觉启发语言模型
9.1 视觉启发摘要
9.2 视觉启发问题提出及相关工作
9.2.1 视觉启发问题提出
9.2.2 视觉启发相关工作
9.3 视觉启发方法
9.3.1 准备工作
9.3.2 特征金字塔视觉提取器
9.3.3 深度视觉条件提示
9.4 视觉启发实验结果
9.4.1 实验细节
9.4.2 方法的数据效率
9.4.3 科学QA
9.4.4 图像字幕
9.4.5 视觉问答实验与问答任务
9.4.6 消融研究
9.5 小结
第10章VinVL:重新审视视觉语言模型中的视觉表示
10.1 审视视觉表示摘要
10.2 审视视觉表示问题提出与相关工作
10.2.1 审视视觉表示问题提出
10.2.2 提高视觉语言的视觉能力
10.2.3 VL任务的高效区域特征提取器
10.3 OSCAR+预训练
10.3.1 预训练语料库
10.3.2 预训练目标
10.3.3 预训练模型
10.3.4 适应VL任务
10.4 审视视觉表示实验与分析
10.4.1 主要成果
10.4.2 消融分析
10.5 小结
第11章视觉语境提示
11.1 视觉语境提示摘要
11.2 视觉语境提示问题提出与相关工作
11.3 视觉语境提示方法
11.3.1 分段任务的统一公式
11.3.2 视觉提示公式
11.3.3 快速采样
11.3.4 解码器查询公式
11.4 视觉语境提示实验
11.4.1 安装程序
11.4.2 通用分割和检测
11.4.3 视频对象分割
11.4.4 消融方法
11.5 视觉语境提示相关工程
11.5.1 通过文本提示进行视觉感知
11.5.2 通过图像示例进行视觉感知
11.5.3 通过视觉提示进行视觉感知
11.6 小结
第12章ViTamin:在视觉语言时代设计可扩展的视觉模型
12.1 设计可扩展摘要
12.2 设计可扩展导言
12.3 设计可扩展相关工作
12.4 设计可扩展方法
12.4.1 CLIP和训练协议
12.4.2 CLIP环境中视觉模型的基准测试
12.4.3 ViTamin的设计
12.5 设计可扩展实验
12.5.1 实施细节
12.5.2 主要成果
12.5.3 新的下游任务套件
12.6 小结
第13章AnomalyCLIP:用于零样本异常检测的对象诊断快速学习
13.1 零样本异常检测诊断摘要
13.2 零样本异常检测诊断简介
13.3 零样本异常检测诊断的计算
13.4 AnomalyCLIP:对象-语义提示学习
13.4.1 方法概述
13.4.2 对象-语义文本提示设计
13.4.3 学习一般异常和正常提示
13.5 零样本异常检测诊断实验
13.5.1 实验设置
13.5.2 主要结果
13.5.3 消融研究
13.6 零样本异常检测诊断相关工作
13.7 小结
第14章任何促使分布泛化的转变
14.1 分布泛化摘要
14.2 分布泛化导言
14.3 分布泛化基础知识
14.4 分布泛化任何移位提示
14.4.1 快速建模
14.4.2 训练和推理
14.5 分布泛化相关工作
14.6 分布泛化实验
14.6.1 各种分配变动的结果
14.6.2 消融研究
14.7 小结
第15章探索视觉语言模型的前沿:当前方法和未来方向综述
15.1 视觉语言模型前沿摘要
15.2 视觉语言模型前沿导言
15.3 视觉语言模型类型
15.3.1 视觉语言理解
15.3.2 使用多模式输入生成文本
15.3.3 多模态输出与多模态输入
15.4 视觉语言模型未来发展方向
15.5 小结
参考文献
买过这本书的人还买过
读了这本书的人还在读
同类图书排行榜