当前位置: 首页 > article >正文

2025年CNN与Transformer融合的创新点思路

CNN+Transformer这类结构其实一直都挺火的,核心在于他们的互补性。因为在一些复杂的AI应用中,单个模型很难同时高效处理多种类型的数据。如果结合CNN在图像处理上的强大能力和Transformer在序列数据处理上的优势,就可以增加模型处理的灵活性,提高计算效率。

这种结构也是非常热门的毕业or小论文选择,刚刚过去的2024年就有相当多顶会顶刊成果,感兴趣的同学们抓紧。目前CNN+Transformer比较常见的创新就是架构设计创新、注意力机制优化、特征融合策略改进、预训练与微调策略创新、特定领域应用...

本文根据这些方向提供15个最新的CNN+Transformer创新点参考,基本都有代码可复现,帮大家节省了查找的时间,有论文需求的同学可无偿获取,希望大家科研顺利哦!

全部论文+开源代码需要的同学看文末

LEFormer: A hybrid CNN-transformer architecture for accurate lake extraction from remote sensing imagery

方法:论文提出了一种结合卷积神经网络(CNN)和Transformer的混合架构,用于从遥感图像中准确提取湖泊。SCTNet通过在训练阶段使用transformer语义信息来提高实时语义分割性能,解决了传统双分支方法中计算开销高和推理速度慢的问题,实现了新一代的状态SOTA结果。

创新点:

  • SCTNet 引入了一种创新的单分支架构,能够在不增加推理计算成本的情况下提取高质量的长程语境信息。

  • 提出了 CF-Block 和语义信息对齐模块,帮助 SCTNet 在训练过程中从 transformer 分支捕获丰富的语义信息。

  • 通过将 GFA 中的矩阵乘法替换为逐像素卷积操作,保留了特征图的空间结构,同时降低了推理延迟。

TractGraphFormer: Anatomically Informed Hybrid Graph CNN-Transformer Network for Classification from Diffusion MRI Tractography

方法:论文提出了一种名为TractGraphFormer的混合模型,将Graph CNN与Transformer结合,通过整合局部解剖信息和全局特征依赖性提升基于扩散MRI纤维束成像的性别预测性能,通过改进网络结构和实验验证,显著提升了分类性能。

创新点:

  • TractGraphFormer框架结合了Graph CNN和Transformer架构,首次在扩散MRI束流追踪中同时捕获局部解剖关系和全局特征依赖。

  • 提出了一个注意力模块,以解释性别预测任务中的预测性束流。

  • 引入了一个新的组合图,综合考虑了白质(WM)和灰质(GM)信息。

WiTUnet: A U-shaped architecture integrating CNN and Transformer for improved feature alignment and local information fusion

方法:论文提出了一个结合卷积神经网络和Transformer的新型网络架构WiTUnet,用于低剂量计算机断层扫描图像的去噪。WiTUnet通过嵌套密集的跳跃路径和窗口化的Transformer结构,改善特征对齐和局部信息融合,显著提升了LDCT图像的去噪效果和图像质量。

创新点:

  • WiTUnet通过引入窗口注意力机制和LiPe模块,实现了在保持低计算开销的同时,显著提升去噪性能。

  • 通过使用局部增强窗口(LeWin)Transformer模块,WiTUnet有效减少了高分辨率特征图中的计算需求,同时在U-net架构中成功应用,提升了图像重建的效果。

  • WiTUnet通过调整特征通道数量(C值),找到了计算效率与去噪效果之间的最佳平衡。

CST-YOLO: A Novel Method for Blood Cell Detection Based on Improved YOLOv7 and CNN-Swin Transformer

方法:论文提出了一种名为CST-YOLO的模型,它是基于YOLOv7架构,并通过引入CNN-Swin Transformer模块来增强模型的特征提取能力。此外,还引入了三个其他有用的模块:加权高效层聚合网络(W-ELAN)、多尺度通道分割(MCS)和连接卷积层(CatConv),以提高小目标检测的精度。

创新点:

  • 引入了一种新的小目标检测模型CST-YOLO,通过结合YOLOv7架构和Swin Transformer,首次实现了Transformer与YOLOv7的融合。

  • 引入了加权高效层聚合网络(W-ELAN)、多尺度通道分割(MCS)和拼接卷积层(CatConv)等模块。

关注下方《学姐带你玩AI》🚀🚀🚀

回复“卷结合思路”获取全部方案+开源代码

码字不易,欢迎大家点赞评论收藏


http://www.kler.cn/a/506931.html

相关文章:

  • sparkSQL练习
  • excel仅复制可见单元格,仅复制筛选后内容
  • 设计模式03:行为型设计模式之策略模式的使用情景及其基础Demo
  • Linux系统离线部署MySQL详细教程(带每步骤图文教程)
  • java根据模板导出word,并在word中插入echarts相关统计图片以及表格
  • JavaScript-正则表达式方法(RegExp)
  • 引用 CPP
  • Chapter1:初见C#
  • C# 并发和并行的区别--16
  • JavaScript分页的制作
  • 【WRF-Urban】新增静态输入数据:URB_PARAM、FRC_URB2D、AHE等
  • redis性能优化参考——筑梦之路
  • 复古怀旧美感35mm胶片模拟色调颗粒汽车商业摄影Lightroom调色预设 Mike Crawat 2024 35MM FILM LOOK PRESETS
  • polarDB报错column reference is ambiguous
  • 手机壁纸设计技巧:打造个性化视觉盛宴
  • zustand 切片模式使用,persist 中间件持久化状态
  • 使用 Kubernetes 实现负载均衡
  • 初步认识 Neo4j 图数据库
  • 《零基础Go语言算法实战》【题目 4-3】请用 Go 语言编写一个验证栈序列是否为空的算法
  • Linux(CentOS/CTyunOS)缺少GBK、GB2312中文字符集
  • 【设计模式-结构型】代理模式
  • RK3568笔记七十四:AP配网实现
  • VLAN是什么?有什么作用?
  • 高效构建与部署Python Web应用:FastAPI的测试与持续集成
  • 基于单片机的智能输液系统
  • C#中委托和函数类的关系