基于VMamba框架和通道-空间注意力机制的场景文本检测方法

123技术园

首页 / 技术内容

2025-02-23 12:12

No.1343194137209610240

技术概要

PDF全文

本申请涉及一种基于VMamba框架和通道‑空间注意力机制的场景文本检测方法、装置和计算机设备。该方法包括:获取包含文本的场景图像参考样本数据集和增强样本数据集；基于VMamba框架采用可变形卷积构建可变形VMamba特征编码器，获得各场景图像分别对应的多尺度文本实例特征图；采用插值和最大池化方法获得平衡特征图；基于通道‑空间注意力机制构建GASM模块，得到逐像素增强后的文本实例特征；构建傅里叶特征解码器，获得重构的文本实例轮廓；采用损失函数训练以增强样本数据集为输入、文本实例轮廓为输出的场景文本检测模型。采用本方法能够实现拥有全局感受野、快速收敛和精准定位的场景文本检测。

背景技术

文本检测可视为目标检测的特殊形式，广泛应用于文本信息提取和高级驾驶辅助系统等领域。然而，现实场景中的文本形状多样性、复杂背景和变化的光照条件，往往导致图像细节丢失，给文本检测带来重大挑战。传统方法依赖显著文本特征，通过连通分量分析或滑动窗口等技术手工设计特征，但在自然场景中难以捕捉上下文信息，对多向或任意形状文本的处理能力有限。近年来，研究人员提出多种文本检测方法，虽然对场景文本检测问题有所改进，但对任意形状的场景文本检测仍存在着一定的问题，包括任意形状场景文本数量稀少会导致普通的场景文本检测模型存在训练数据不够；传统场景文本检测模型所采用的视觉基础架构缺乏长程依赖建模能力，或有着二次计算复杂度，无法扩展，且收敛速度较慢；VMamba框架中的十字形激活机制在捕获复杂文本的局部信息方面遇到了限制；仅仅关注单一维度特征，会阻碍任意形状的场景文本检测模型的表征能力。

实现思路

阅读余下40%

技术概要为部分技术内容，查看PDF获取完整资料

该技术已申请专利，如用于商业用途，请联系技术所有人！

技术研发人员：

胡政赵英男丁方琪张德文杨祖国江结林

技术所属：南京信息工程大学

相关技术

变压器呼吸器变色检测方法、装置、系统及电子设备  变压器呼吸器变色检测方法、装置、系统及电子设备 
 本发明实施例提出一种变压器呼吸器检测方法、装置、系统及电子设备，属于图像检测领域。方法包括:检测出待测的变压器呼吸器的原始图像中的硅胶框，得到硅胶图像；利用像素检测模型对硅胶图像进行逐像素检测，得到与硅胶图像的像素点一一对应的多个像素检测结果；依据多个像素检测结果，获得硅胶图像的检测特征值，进而依据检测特征值，获得变压器呼吸器的变色检测结果。如此，先检测出原始图像中的硅胶框，并逐像素地进行局部细致检测，从而能够检测出硅胶区域(即硅胶框内)的每个像素点是否变色，同时排除了非硅胶区域的干扰，大大提高了检测精度，从而提高了变压器呼吸器的变色检测结果的正确率。
基于机器视觉和AR的虫害检测与管理系统  基于机器视觉和AR的虫害检测与管理系统 
 本发明属于图像处理技术领域，具体涉及基于机器视觉和AR的虫害检测与管理系统。所述系统包括:图像获取部分，用于获取目标农作物的超分辨率图像和光谱图像；对超分辨率图像和光谱图像分别进行图像预处理；图像区域提取部分，用于从预处理超分辨率图像中识别出目标农作物的叶片区域和茎秆区域；虫害判断部分，用于对光谱图像中的叶片区域和茎秆区域进行光谱分析；虫害分析部分，用于在判断结果为真的情况下，从预处理超分辨率图像中叶片区域；AR显示部分，用于在AR设备中显示目标农作物的病虫害区域。本发明实现了对农作物病虫害的自动识别和实时监测。结合先进的图像处理和机器学习算法，能够快速准确地提取特征、分析病虫害情况。
一种电路板的故障快速检测方法、系统及存储介质  一种电路板的故障快速检测方法、系统及存储介质 
 本发明公开了一种电路板的故障快速检测方法、系统及存储介质，涉及电路板的技术领域，其中视觉检测模块通过红外摄像头捕捉电路板图像，并利用图像处理技术划分检测区域，识别钻孔程度和判断通过孔是否偏离，从而进一步分析通过孔偏离对电路板性能造成的影响，信息采集模块对孔内壁进行检测和记录，获取相关残留材料信息，同时监测电路板的性能变化信息和热分布状态信息，为后续的故障综合分析提供全面的数据支持；故障综合分析模块对数据检测集进行特征提取，并通过训练后的故障检测模型计算得到故障评估指数Gpzs，实现对电路板故障的综合评估和分析，通过对故障评估指数Gpzs与故障阈值W进行对比分析，得出故障评分报告，采取相应的分拣作业。
遥感影像检测方法、装置、电子设备及存储介质  遥感影像检测方法、装置、电子设备及存储介质 
 本发明提出一种遥感影像检测方法、装置、电子设备及存储介质，属于图像处理领域，解决了现有的遥感影像目标检测的检测速度慢、准确率低的问题。方法包括:对遥感图像进行裁剪，得到多张待测图像；针对每张待测图像，采用预先训练的目标检测模型，得到待测图像中的目标框；依据待测图像对应的裁剪位置，将带有目标检测结果的各待测图像进行拼接，得到已测图像；对已测图像中的目标框去重，得到遥感图像的检测结果。本发明减小了模型处理单张图像时的数据量，缩短检测时长，且通过模型检测和目标框去重，排除掉了更多的外部干扰，从而提高检测速度和准确度。
一种基于在网计算的流表压缩方法  一种基于在网计算的流表压缩方法 
 本发明公开了一种基于在网计算的流表压缩方法，属于软件定义网络技术领域。针对在软件端侧聚合方法的不足和软件端侧处理流量能力不足的问题，通过1.设置并初始化流表规则，经过二叉树结构分解成互不重叠的规则；2.将互不重叠的规则压缩成可以进行算术运算的表达式规则，并将表达式规则部署在网络可编程交换机；3.在该网络可编程交换机内利用表达式规则匹配网络流量，并依照表达式规则的动作字段转发网络流量到相应的目的地址。本发明利用网络可编程交换机的算术计算功能，和软件侧压缩的表达式流表，实现网络处理大规模流量并转发的功能，减少了网络可编程交换机存储的流表数量，有效降低存储开销，提高了网络通信效率。
一种基于分段信道估计的通感一体化系统干扰消除方法  一种基于分段信道估计的通感一体化系统干扰消除方法 
 本发明公开了一种基于分段信道估计的通感一体化系统干扰消除方法，步骤为:建立无蜂窝协作通感一体化系统的信道模型和数据传输模型，通过所有用户发送上行导频，中央处理器CPU估计出用户与接入节点AP之间的数据传输信道；通过所有下行接入节点AP发送目标检测信号，所有上行接入节点AP联合接收信号，中央处理器CPU检测感知目标是否在场景中；通过所有下行接入节点AP发送下行导频，中央处理器CPU得到接入节点AP之间的交叉链路干扰信道的估计；系统同时进行上下行通信和对目标移动方向和速度的感知，并基于信道估计结果，对接受到的通信和感知信号分别进行干扰消除处理。本发明能够有效地直接抑制系统干扰，提升通信和感知性能。
一种基于上半身姿态的驾驶员情绪状态检测方法及系统  一种基于上半身姿态的驾驶员情绪状态检测方法及系统 
 本发明公开了一种基于上半身姿态的驾驶员情绪状态检测方法及系统，涉及计算机视觉技术领域，包括:基于预设人体姿态估计模型识别待检测驾驶员的上半身视频片段中的人体关键部位，得到各关节位置的时间序列；对关节位置时间序列进行预处理，转化成关节流数据和骨骼流数据；分别将关节流和骨骼流数据输入到多个经过训练之后的图卷积神经网络模型，得到多个分类结果；基于集成学习方法融合多个分类结果，得到待检测驾驶员的情绪状态识别结果。本发明缓解了现有技术中存在的在驾驶环境下的动作情绪识别准确率较差的技术问题。
一种引入RBU的轻量化皮革表面缺陷显著目标检测方法  一种引入RBU的轻量化皮革表面缺陷显著目标检测方法 
 本发明提出一种引入RBU的轻量化皮革表面缺陷显著目标检测方法，获取皮革表面图像，对其进行预处理；利用模型RBU＆lt;supgt;2＆lt;/supgt;Net对预处理后的图像进行目标检测。本发明提出残差瓶颈U型块作为特征提取单元，融合了深度可分离卷积和通道注意力的性能优势，在一定程度上解决了工业生产线上的自动化皮革缺陷检测存在计算设备受限的困境。通过在模型中引入临近特征增强模块，强化模型对于多尺度特征的融合能力，优化目前在皮革检测领域无法准确刻画缺陷形状的情况。另外，还引入像素混合采样提高了特征信息利用率，增强模型的空间感知能力，使其在检测具有种类繁多、缺陷形状无规则、尺度变化范围大等皮革表面缺陷时，提升皮革检测的精确度。
一种基于金字塔的SAR图像相干斑抑制方法  一种基于金字塔的SAR图像相干斑抑制方法 
 本发明给出一种基于金字塔的SAR图像相干斑抑制方法。首先，将四种不同的残差模块级联成的残差块加到噪声估计的阶段，可以更充分地利用不同深度的残差模块对特征信息的提取，来促进学习过程；然后，采样多尺度的特征信息得到一个五级金字塔，可充分利用不同尺度的感受野以提取到多样化的、不同尺度空间的特征信息；最后，利用得到的多尺度特征信息进行融合、去噪，得到去噪后的图像，上下文信息对去噪后的图像保留细节信息有帮助。本发明利用四种不同的残差模块级联成的残差块和基于金字塔的思维对SAR图像进行多尺度特征提取、融合和去噪，实现了对真实SAR图像的去噪，并有效地保留图像去噪后的细节特征，显现了优异的去噪性能，具有广泛的适用性。
一种考虑多层级特征的多类别点云异常检测方法及系统  一种考虑多层级特征的多类别点云异常检测方法及系统 
 本发明属于三维检测相关技术领域，其公开了一种考虑多层级特征的多类别点云异常检测方法及系统，方法包括:提取训练用点云数据的多维特征，获得局部特征和全局特征；对全局特征进行聚类获得多个聚类中心，组成类别记忆库；在类别记忆库中获得与每个训练用点云数据的全局特征距离最近的聚类中心作为该目标聚类中心，提取集合的核心集作为子记忆库；利用待测点云数据的全局特征获得对应的目标子记忆库，而后利用待测点云数据的局部特征在目标子记忆库中查找距离最近的目标特征；计算待测点云数据的局部特征与目标特征之间的距离获得异常分数，依据异常分数判断待测点云数据的异常情况。本申请解决了多类数据相似导致的特征混淆问题的技术问题。

技术分类

电信、广播电视和卫星传输服务电信、广播电视和卫星传输服务

互联网软件服务互联网软件服务

集成电路设计集成电路设计

信息集成数字服务信息集成数字服务

电气机械制造电气机械制造

计算机、通信、电子设备制造计算机、通信、电子设备制造

医药制造、生物基材料医药制造、生物基材料

石油煤矿化学用品加工石油煤矿化学用品加工

化学原料制品加工化学原料制品加工

非金属矿物加工非金属矿物加工

金属制品加工金属制品加工

专用设备制造专用设备制造

通用设备制造通用设备制造

通用零部件制造通用零部件制造

汽车制造业汽车制造业

铁路、船舶、航天设备制造铁路、船舶、航天设备制造

电力、热力生产和供应电力、热力生产和供应

燃气生产和供应燃气生产和供应

水生产和供应水生产和供应

房屋建筑、土木工程房屋建筑、土木工程

交通运输、仓储和邮政交通运输、仓储和邮政

农、林、牧、渔业农、林、牧、渔业

采矿业采矿业

农副、食品加工农副、食品加工

烟草、酒水加工烟草、酒水加工

纺织皮具居家制品纺织皮具居家制品

文教体娱加工文教体娱加工