当前位置: 首页 > article >正文

2024 CVPR Highlight Learning-Feedback

图像增强

Towards Robust Event-guided Low-Light Image Enhancement: A Large-Scale Real-World Event-Image Dataset and Novel Approach

解决的主要问题是低光照条件下的图像增强

通过多尺度整体融合分支提取事件和图像的结构和纹理信息,并引入信噪比(Signal-to-Noise Ratio, SNR)引导的区域特征选择,以增强低SNR区域的图像

嵌入表示

 Transcriptomics-guided Slide Representation Learning in Computational Pathology

试图解决的主要问题是如何在计算病理学中有效地从整个千兆像素级的全切片图像学习到有用的嵌入表示

使用ViT来编码组织学幻灯片的图像块,以及使用MLP来编码基因表达数据,通过对比学习对齐

除了对比损失外,作者还引入了表达重建目标和视觉内模态目标

事件相机

  Bilateral Event Mining and Complementary for Event Stream Super-Resolution

旨在解决现有事件相机在复杂场景应用中面临的空间分辨率不足的挑战

采用双流网络分别独立处理正事件和负事件,并通过提出的双边信息交换模块促进两流之间的信息交换

扩散模型

GPLD3D: Latent Diffusion of 3D Shape Generative Models by Enforcing Geometric and Physical Priors

旨在解决现有3D形状生成模型在几何可行性和物理稳定性方面的一些关键问题

  Ranni: Taming Text-to-Image Diffusion for Accurate Instruction Following

旨在解决现有文本到图像扩散模型在解释复杂提示时通常遇到的挑战

引入一个语义面板作为中间件,这个面板通过大型语言模型解析输入文本中的视觉概念,然后将其注入到去噪网络中,作为详细的控制信号以补充文本条件

 EscherNet: A Generative Model for Scalable View Synthesis

试图解决的主要问题是如何学习一个通用的3D表示,以便于实现可扩展的视图合成

EscherNet学习与场景颜色和几何形状相关的隐式表示

 3D重建

MultiPly: Reconstruction of Multiple People from Monocular Video in the Wild

旨在解决从单目野外视频中重建多个人物的3D模型这一具有挑战性的任务

定义整个场景的分层神经表示、使用分层可微体积渲染从视频中学习该表示(为场景中的每个人定义一个3D形状和外观的隐式神经表示,这些表示在场景中是分层和交织的)

图像生成

  Instruct-Imagen: Image Generation with Multi-modal Instruction

  1. 多模态指令引入

  2. 两阶段训练方法

    • 第一阶段:检索增强训练

    • 第二阶段:多模态指令微调

  3. 模型架构设计:Instruct-Imagen基于预训练的文本到图像扩散模型,通过添加一个交叉注意力层来编码多模态指令

 Attention Calibration for Disentangled Text-to-Image Personalization

试图解决的问题是如何从单个参考图像中捕捉多个新颖概念

引入新的可学习修饰符与类别绑定以捕获多个概念的属性,并通过分离和加强不同类别的注意力图来减少概念间的相互影响

姿态估计

 Matching 2D Images in 3D: Metric Relative Pose from Metric Correspondences

目标是在不需要额外的深度测量或场景重建信息的情况下,通过学习跨图像匹配3D坐标,实现无需尺度的相对相机姿态估计

深度估计

Repurposing Diffusion-Based Image Generators for Monocular Depth Estimation

探索现代生成性扩散模型中捕获的广泛先验知识是否能够使深度估计更加准确和泛化。

Marigold是一种基于Stable Diffusion的仿射不变单目深度估计方法,它保留了丰富的先验知识


http://www.kler.cn/a/524799.html

相关文章:

  • 指针的介绍3后
  • Java创建项目准备工作
  • Git进阶之旅:Git 配置信息 Config
  • 【PySide6快速入门】QLineEdit 输入框
  • 开源 OA 办公系统
  • 8639 折半插入排序
  • C# 环境:深入探讨与优化
  • Python中的函数(上)
  • 十大主流联邦学习框架:技术特性、架构分析与对比研究
  • 【电工基础】1.电能来源,触电伤害,触电预防,触电急救
  • 从 SAP 功能顾问到解决方案架构师:破茧成蝶之路
  • 联想拯救者R720笔记本外接显示屏方法,显示屏是2K屏27英寸
  • Kubernetes(一)
  • HBuilderX构建Vue项目
  • Redis缓存穿透,雪崩,击穿
  • C26.【C++ Cont】动态内存管理和面向对象的方式实现链表
  • Vue.js `setup()` 函数的使用
  • Vuex中的getter和mutation有什么区别
  • 团体程序设计天梯赛-练习集——L1-025 正整数A+B
  • AttributeError: can‘t set attribute ‘lines‘
  • 【Proteus仿真】【51单片机】多功能计算器系统设计
  • 力扣题目【6. Z 字形变换】 Java题解
  • SQL UCASE() 函数详解
  • 将DeepSeek接入Word,打造AI办公助手
  • Spring AI 在微服务中的应用:支持分布式 AI 推理
  • RK3568使用opencv(使用摄像头捕获图像数据显示)