热点
【站长发帖】数码互联时代物联网安全与移动风险防控指南,reasoning_content:我们要求以网站管理员的口吻,写一个与技术、科技相关,关于物联网安全与移动风险防控:数码互联时代的防护指南的标题需要简短精炼,30字以内直接输出标题,不要加说明nn考虑用“网站管理员”的口吻,可以包含“站长发帖”、“管理员提醒”之类的语气但标题本身需要是文章标题可能类似:“物联网安全与移动风险防控:数码互联时代的防护指南”本身就是副标题?我们需要重新构思一个更简短的标题nn示例:“【站长发帖】物联网安全与移动风险防控指南”但字数可能超?要30字以内或者“数码互联时代的防护指南:物联网安全与移动风险防控”太长nn更精炼:“物联网安全与移动风险防控指南”正好?但缺少“数码互联时代”的修饰可以:“数码互联时代:物联网安全与移动风险防控” 字数:14个字?数一下:“数码互联时代:物联网安全与移动风险防控” 共15个汉字?实际:数码互联时代(5字)+冒号+物联网安全与移动风险防控(11字)=16字?再算:数码互联时代(5个字符),冒号1,物联网安全与移动风险防控(11个字符),总17个字符,可以nn但需要以网站管理员口吻,可以在前面加“管理员提示:”但这样可能变成“管理员提示:数码互联时代:物联网安全与移动风险防控” 字数:管理员提示(4字)+冒号+后面17字=22字,可以但“管理员提示”不太像标题可以用“【管理员专刊】”之类的但要求直接输出标题,不要说明,所以最好就是标题本身nn考虑到用户要求:以'网站管理员'的口吻,意思是标题的表述应该是从管理员视角出发,比如“本站管理员提醒:...”但这样太啰嗦更常见的做法是在标题中体现“站长发帖”或“管理员解读”之类的词语,比如“站长发帖:物联网安全与移动风险防控指南”字数:站长发帖(4)+冒号+后面13?实际“物联网安全与移动风险防控指南”12字?物联网安全与移动风险防控指南:物联网(3)+安全(2)+与(1)+移动(2)+风险(2)+防控(2)+指南(2)=14字?数一下:物联网(3)、安全(2)、与(1)、移动(2)、风险(2)、防控(2)、指南(2) 共14个汉字,加上冒号和站长发帖4字共19字,符合30字内但需要体现“数码互联时代”吗?原文有“数码互联时代的防护指南”,可以简化成“数码互联时代防护指南”但字数超?其实可以合并:“数码互联时代物联网安全与移动风险防控指南”字数:数码互联时代(5)+物联网安全与移动风险防控指南(14)=19字,也很简洁但这样没有管理员口吻nn最好的办法:在标题前加“【站长发帖】”或“【管理员提醒】”等例如:“【站长发帖】数码互联时代物联网安全与移动风险防控指南” 字数:中括号加站长发帖(8个字符?实际上【站长发帖】是5个汉字?【和】算标点,站长发帖4字,共6字符?准确:'【站长发帖】'共5个字符(左括号、站、长、发、帖、右括号?等等,【是1个字符,站1,长1,发1,帖1,】1,共6个字符)然后加空格?直接连接:“【站长发帖】数码互联时代物联网安全与移动风险防控指南” 总汉字数:6+5+14=25个字符?数一下:【站长发帖】6个字符,数码互联时代5个字符,物联网安全与移动风险防控指南14个字符,共25字符,符合30字以内但注意中文字符算一个,英文标点也算一个应该没问题或者更简洁:“【站长发帖】物联网安全与移动风险防控” 但少了数码互联时代考虑到原文主题是“数码互联时代的防护指南”,保留更好nn另一种:“管理员必读:数码互联时代物联网安全与移动风险防控” 字数:管理员必读(4)+冒号(1)+后面(5+14=19)=24也可以nn但用户要求“简短精炼”,可能不需要太多前缀我觉得直接输出“数码互联时代物联网安全与移动风险防控指南”也可以,因为用户说“以'网站管理员'的口吻”,但没说一定要在标题中出现“管理员”字样口吻可以体现在风格上,比如用“指南”这种建议性词汇但为了明确符合要求,最好加上“站长发帖”或“管理员提示”之类nn权衡后,我选择:“【站长发帖】数码互联时代的物联网安全与移动风险防控指南” 检查字数: 【站长发帖】6字 + 数码互联时代的(7字?数码互联时代是5字,加“的”1字共6字?注意:数码互联时代是5个汉字?数:数、码、互、联、时、代——6个?不对,“数码互联时代”是数码(2)、互联(2)、时代(2)总共6个汉字我前面误算了重新计算:数码(2)、互联(2)、时代(2)=6字加上“的”1字=7字然后“物联网安全与移动风险防控指南”——物联网(3)、安全(2)、与(1)、移动(2)、风险(2)、防控(2)、指南(2)=14字加上前面的”【站长发帖】6字,总6+7+14=27字符合30字内可以nn为了更精炼,可以去掉“的”字:“【站长发帖】数码互联时代物联网安全与移动风险防控指南” 这样数码互联时代6字 + 物联网...14字 + 前缀6字 = 26字很好nn但注意:原主题有“移动风险防控”,我写的是“物联网安全与移动风险防控”,其中“与”字是否必要?可以改为“物联网安全及移动风险防控”但“及”字也是“物联网安全移动风险防控”可能歧义保持原样nn最终标题定为:“【站长发帖】数码互联时代物联网安全与移动风险防控指南”nn输出时直接写这个
iOS安全开发精进:语言特性、函数封装与变量管理,reasoning_content:我们要求以数据安全工程师的口吻,写一个与技术、科技相关,关于iOS开发精进:语言特性精通、函数封装技巧与变量管理规范的标题需要简短精炼,30字以内直接输出标题nn注意口吻是数据安全工程师,那么标题应该体现安全视角,同时涵盖iOS开发的语言特性、函数封装、变量管理可以结合安全考虑,比如变量管理规范可能涉及数据安全、内存安全等建议标题如:iOS安全开发:语言特性、函数封装与变量管理规范 但字数可能超?计算:iOS安全开发:语言特性、函数封装与变量管理规范 共?中文字符+标点实际上“iOS安全开发:语言特性、函数封装与变量管理规范” 有18个汉字+2个冒号+2个逗号?不,冒号一个,逗号两个?实际是“iOS安全开发:语言特性、函数封装与变量管理规范” 汉字:iOS(3个英文字母算?通常标题中英文算一个字符?但要求30字以内,通常指汉字字数可考虑用更简洁的或者数据安全视角下的iOS开发精进:语言特性与变量管理 但缺少函数封装或者iOS精进:安全编码中的语言特性、封装与变量管理 等等nn为了体现数据安全工程师口吻,可加入安全编码、防护等词尝试:数据安全工程师谈iOS开发:语言特性、函数封装与变量管理规范 太长精简:iOS安全开发精进:语言特性与变量管理规范 缺少函数封装加上函数封装:iOS安全开发精进:语言特性、函数封装与变量管理 字数:iOS安全开发精进:语言特性、函数封装与变量管理 共?汉字:安、全、开、发、精、进、语、言、特、性、函、数、封、装、与、变、量、管、理 -> 19个汉字,加上冒号和英文iOS(3个英文)但通常算字符数,英文按一个字符算,总字符22,符合30字以内可以nn为了更准确,用中文全称?iOS开发精进:安全视角下的语言特性与变量管理 不够全面我觉得上面那个不错或者更直接:安全编码:iOS语言特性、函数封装与变量管理规范 但少了精进最终决定:直接输出一个标题
用户调研|VR后端必备:MsSql存储与触发器实战,reasoning_content:我们要求以用户调研专员的口吻,写一个与技术、科技相关,关于[VR数据后端必备:MsSql存储与触发器实战解析]的标题直接输出一个标题,不要加说明提示等字数30字以内nn注意:口吻是用户调研专员,所以要体现调研、用户角度?还是说只是模拟这个角色的口吻?实际上标题需要简洁,可能偏向于技术内容用户调研专员通常是了解用户需求、做调研的,所以标题可以强调用户侧或调研发现之类的但更直接的是,要求写一个标题,主题是VR数据后端必备的MsSql存储与触发器实战解析我们直接写一个标题nn例如:VR后端调研:MsSql存储与触发器实战解析 但字数有点多,且可能不够精炼或者:用户调研|VR后端必备:MsSql存储与触发器实战 但需要控制在30字内我们数一下:用户调研|VR后端必备:MsSql存储与触发器实战 共22字(包括符号)符合nn或者更简洁:VR数据后端必备:MsSql存储与触发器实战解析 但没说用户调研专员口吻可以在前面加调研发现:之类的但直接输出标题,不解释nn考虑用户调研专员可能是在做用户调研后得出的结论,所以标题可以带有调研字样例如:调研报告:VR后端MsSql存储与触发器实战 约16字或者:VR数据后端实战:MsSql存储与触发器(用户调研版) 但有点长nn最终我选择:用户调研|VR后端必备:MsSql存储与触发器实战 共21个字(包括标点),且符合要求
网站管理员必备:政策编程核心之语言、函数与变量管理技巧,reasoning_content:我们要求以网站管理员的口吻,写一个与技术、科技相关,关于[政策编程核心:语言选择、函数构建与变量管理技巧]的标题直接输出一个标题,不要加说明提示等信息,简短精炼,字数控制在30字以内nn注意:题目中给出的内容是政策编程核心:语言选择、函数构建与变量管理技巧,这个应该是主题作为网站管理员的口吻,可能要用网站管理员的视角,比如作为网站管理员,你需要了解...,但标题要简短可以写成类似网站管理员必读:政策编程核心技巧之类的但要求直接输出标题nn考虑精炼:比如政策编程核心:语言、函数与变量管理技巧——网站管理员指南但字数可能超或者网站管理员:政策编程的语言、函数与变量技巧最好在30字内nn网站管理员必备:政策编程核心技巧 11字但更具体: 政策编程核心:语言选择、函数构建与变量管理 15字,再加网站管理员可能超可以调整为政策编程核心技巧:语言、函数与变量管理——网站管理员 但有点长nn或者【网站管理员】政策编程核心:语言、函数与变量管理 这个16字但注意括号或者网站管理员:政策编程核心之语言、函数与变量管理 字数?数一下:网站管理员:政策编程核心之语言、函数与变量管理 = 9+1+8+1+2+1+1+2+1+1? 直接数:网站管理员(4) :(1)政策编程核心(6)之(1)语言(2)、(1)函数(2)与(1)变量管理(4) = 4+1+6+1+2+1+2+1+4=22字OK,22字但标点算不算?通常中文标点算一个字所以22字可以nn或者更简洁:政策编程核心:语言选择、函数构建与变量管理技巧 本身19字,但前面加网站管理员:就多了4字,共23字但这样直接可以考虑:网站管理员:政策编程核心——语言、函数与变量 但少了管理技巧nn我认为输出一个简洁明了的标题由于是直接输出,不加说明我选:网站管理员:政策编程核心之语言、函数与变量管理 22字nn但注意原题中政策编程核心:语言选择、函数构建与变量管理技巧 有选择、构建、技巧等词可以保留如网站管理员:政策编程核心——语言选择、函数构建与变量管理技巧 字数:网站管理员(4)+:(1)+政策编程核心(6)+——(2)+语言选择(4)+、(1)+函数构建(4)+与(1)+变量管理技巧(6) = 4+1+6+2+4+1+4+1+6=29字刚好30字内但用了破折号和逗号或者去掉破折号用空格?但中文标题常用破折号可以接受nn考虑更短:政策编程核心:语言选择、函数构建与变量管理技巧(网站管理员) 这个字数:政策编程核心6+:1+语言选择4+、1+函数构建4+与1+变量管理技巧6+(1+网站管理员4+)1 = 6+1+4+1+4+1+6+1+4+1=29字也可以nn我选择第二种:政策编程核心:语言选择、函数构建与变量管理技巧(网站管理员) 29字nn但题目要求以'网站管理员'的口吻,所以最好网站管理员出现在前面比如网站管理员必看:政策编程核心语言、函数与变量管理技巧 数一下:网站管理员(4)必看(2):(1)政策编程核心(6)语言(2)、(1)函数(2)与(1)变量管理技巧(6) = 4+2+1+6+2+1+2+1+6=25字OKnn更简洁:网站管理员必备:政策编程核心语言、函数与变量技巧 24字nn我决定使用:网站管理员必备:政策编程核心之语言、函数与变量管理技巧 字数:网站管理员(4)必备(2):(1)政策编程核心(6)之(1)语言(2)、(1)函数(2)与(1)变量管理技巧(6) = 4+2+1+6+1+2+1+2+1+6=26字很好nn注意:题目中政策编程核心可能是个专有名词,不要改动所以这个标题保留了政策编程核心nn最终输出
PHP模块化产品设计:灵活配置,效率飙升,reasoning_content:我们要求以性能优化师的口吻,写一个与“技术、科技”相关,关于[PHP赋能运营中心:模块化产品设计,灵活配置提升效率]的标题直接输出一个标题,不要加说明提示等信息简短精炼,字数控制在30字以内nn需要体现性能优化师的口吻,可能语气专业、直接、强调效率、优化主题是PHP赋能运营中心,模块化产品设计,灵活配置提升效率nn可能的PHP模块化设计:灵活配置,运营效率飙升或者:PHP赋能运营:模块化配置,性能优化新高度但需要控制30字内nn尝试:PHP模块化产品设计,灵活配置提升运营效率但字数可能超?数一下:PHP模块化产品设计,灵活配置提升运营效率共17字可以nn但要以性能优化师口吻,可以更直接:PHP模块化设计:灵活配置,运营效率翻倍或者:PHP赋能运营:模块化配置,性能优化利器nn最好包含“性能优化师”的身份感,但标题中不一定直接出现“性能优化师”,而是语气专业比如:从性能优化看PHP模块化:灵活配置提升运营效率但字数可能多nn简单:PHP模块化设计:灵活配置,运营效率优化14字nn或者:PHP赋能运营中心:模块化设计,灵活配置提效13字nn考虑到要求是“与‘技术、科技’相关”,标题可以带上技术感最终输出一个标题我选择:PHP模块化产品设计:灵活配置,效率飙升共13字
17 9 月 2026, 周四

丢弃Transformer,全卷积网络也可以实现E2E检测

副标题#e#

在近来研究人员热衷于探索 Transformer 用于目标检测的尝试时,这篇论文提出了一种全新的观点,即利用全卷积网络也可以实现良好的端到端目标检测效果。

目标检测是计算机视觉领域的一个基础研究主题,它利用每张图像的预定义类标签来预测边界框。大多数主流检测器使用的是基于锚的标签分配和非极大值抑制(NMS)等手动设计。近来,很多研究者提出方法通过距离感知和基于分布的标签分类来消除预定义的锚框集。尽管这些方法取得了显著的进展和优越的性能,但抛弃手动设计的 NMS 后处理可能阻碍完全的端到端训练。

基于这些问题,研究人员相继提出了 Learnable NMS、Soft NMS 和 CenterNet 等,它们能够提升重复删除效果,但依然无法提供有效的端到端训练策略。之后,Facebook AI 研究者提出的 DETR 将 Transformer 用到了目标检测任务中,还取得了可以媲美 Faster R-CNN 的效果。但是,DETR 的训练时间却大大延长,在小目标上的性能也相对较低。

所以,在本文中,来自旷视科技和西安交通大学的研究者提出了一个新颖问题:全卷积网络是否可以实现良好的端到端目标检测效果?并从标签分配和网络架构两个方面回答并验证了这一问题。

丢弃Transformer,全卷积网络也可以实现E2E检测

论文链接:https://arxiv.org/pdf/2012.03544.pdf

项目代码:https://github.com/Megvii-BaseDetection/DeFCN (内部代码迁移 + 审查中,后续放出)

具体而言,研究者基于 FCOS,首次在 dense prediction 上利用全卷积结构做到 E2E,即无 NMS 后处理。研究者首先分析了常见的 dense prediction 方法(如 RetinaNet、FCOS、ATSS 等),并且认为 one-to-many 的 label assignment 是依赖 NMS 的关键。受到 DETR 的启发,研究者设计了一种 prediction-aware one-to-one assignment 方法。

此外,研究者还提出了 3D Max Filtering 以增强 feature 在 local 区域的表征能力,并提出用 one-to-many auxiliary loss 加速收敛。本文方法基本不修改模型结构,不需要更长的训练时间,可以基于现有 dense prediction 方法平滑过渡。本文方法在无 NMS 的情况下,在 COCO 数据集上达到了与有 NMS 的 FCOS 相当的性能;在代表了密集场景的 CrowdHuman 数据集上,本文方法的 recall 超越了依赖 NMS 方法的理论上限。

整体方法流程如下图所示:

丢弃Transformer,全卷积网络也可以实现E2E检测

One-to-many vs. one-to-one

自 anchor-free 方法出现以来,NMS 作为网络中最后一个 heuristic 环节,一直是实现 E2E dense prediction 的最大阻碍。但其实可以发现,从 RPN、SSD、RetinaNet 等开始,大家一直遵循着这样一个流程:先对每个目标生成多个预测(one-to-many),再将多个预测去重(many-to-one)。所以,如果不对前一步 label assignment 动刀,就必须要保留去重的环节,即便去重的方法不是 NMS,也会是 NMS 的替代物(如 RelationNet,如 CenterNet 的 max pooling)。

丢弃Transformer,全卷积网络也可以实现E2E检测

那直接做 one-to-one assignment 的方法是否存在呢?其实是有的。上古时代有一个方法叫 MultiBox,对每个目标和每个预测做了 bipartite matching,DETR 其实就是将该方法的网络换成了 Transformer。此外还有一个大家熟知的方法:YOLO,YOLO 也是对每个目标只匹配一个 grid[1] ,只不过它是采用中心点做的匹配,而且有 ignore 区域。

Prediction-aware one-to-one

于是接下来的问题就是,在 dense prediction 上能不能只依赖 one-to-one label assignment,比较完美地去掉 NMS?研究者首先基于去掉 centerness 分支的 FCOS,统一网络结构和训练方法,用 Focal Loss + GIoU Loss,做了如下分析实验:

丢弃Transformer,全卷积网络也可以实现E2E检测

研究者设计了两种 hand-crafted one-to-one assignment 方法,分别模仿 RetinaNet(基于 anchor box)和 FCOS(基于 center 点),尽可能做最小改动,发现已经可以将有无 NMS 的 mAP 差距缩小到 4 个点以内。

但研究者认为手工设计的 label assignment 规则会较大地影响 one-to-one 的性能,比方说 center 规则对于一个偏心的物体就不够友好,而且在这种情况下 one-to-one 规则会比 one-to-many 规则的鲁棒性更差。所以认为规则应该是 prediction-aware 的。研究者首先尝试了 DETR 的思路,直接采用 loss 做 bipartite matching 的 cost[2] ,发现无论是绝对性能还是有无 NMS 的差距,都得到了进一步的改善。

但他们知道,loss 和 metrics 往往并不一致,它常常要为优化问题做一些妥协(比如做一些加权等等)。也就是说,loss 并不一定是 bipartite matching 的最佳 cost。因而研究者提出了一个非常简单的 cost:

丢弃Transformer,全卷积网络也可以实现E2E检测

看起来稍微有点复杂,但其实就是用网络输出的 prob 代表分类,网络输出和 gt 的 IoU 代表回归,做了加权几何平均,再加一个类似于 inside gt box 的空间先验。加权几何平均和空间先验在后面都分别做了 ablation。

这就是研究者提出的 POTO 策略,它进一步地提升了无 NMS 下的性能,也侧面验证了 loss 并不一定是最好的 cost[3]。但从 Table 1 中也发现了,POTO 的性能依旧不能匹敌 one-to-many+NMS 组合。研究者认为问题出在两个方面:

one-to-one 需要网络输出的 feature 非常 sharp,这对 CNN 提出了较严苛的要求(这也是 Transformer 的优势);

one-to-many 带来了更强的监督和更快的收敛速度。

于是分别用 3D Max Filtering 和 one-to-many auxiliary loss 缓解如上问题。

3D Max Filtering

丢弃Transformer,全卷积网络也可以实现E2E检测

如 Figure 3 所示,这个模块只采用了卷积、插值、max pooling 3d,速度非常快,也不需要写 cuda kernel。

One-to-many auxiliary loss

#p#副标题#e##p#分页标题#e#

针对第二点监督不够强、收敛速度慢,研究者依旧采用 one-to-many assignment 设计了 auxiliary loss 做监督,该 loss 只包含分类 loss,没有回归 loss。assignment 本身没什么可说的,appendix 的实验也表明多种做法都可以 work。这里想提醒大家的是注意看 Figure 2 的乘法,它是 auxiliary loss 可以 work 的关键。在乘法前的一路加上 one-to-many auxiliary loss,乘法后是 one-to-one 的常规 loss。由于 1*0=0,1*1=1,所以只需要大致保证 one-to-one assignment 的正样本在 one-to-many 中依然是正样本即可。

实验

最主要的实验结果已经在 Table 1 中呈现了,此外还有一些 ablation 实验。

丢弃Transformer,全卷积网络也可以实现E2E检测

这里 highlight 几点:

α越低,分类权重越大,有无 NMS 的差距越小,但绝对性能也会降低 [4];α太高也不好,后续所有实验用α=0.8;

在α合理的情况下,空间先验不是必须的,但空间先验能够在匹配过程中帮助排除不好的区域,提升绝对性能;研究者在 COCO 实验中采用 center sampling radius=1.5,在 CrowdHuman 实验中采用 inside gt box[5];

加权几何平均数(Mul)[6]比加权算术平均数(Add)[7]更好。

去掉 NMS 的最大收益其实是 crowd 场景,这在 COCO 上并不能很好地体现出来。所以又在 CrowdHuman 上做了实验如下:

丢弃Transformer,全卷积网络也可以实现E2E检测

请注意 CrowdHuman 的 ground-truth 做 NMS threshold=0.6,只有 95.1% 的 Recall,这也是 NMS 方法的理论上限。而本文方法没有采用 NMS,于是轻易超越了这一上限。

研究者还做了其它一些实验和分析,欢迎看原文。

可视化

经过以上改进,研究者成功把 one-to-one 的性能提升到了与 one-to-many+NMS 方法 comparable 的水平。此外还可视化了 score map,可以发现 FCN 是有能力学出非常 sharp 的表示的,这也是很让研究者惊奇的一点。

丢弃Transformer,全卷积网络也可以实现E2E检测

结果图中比较明显的改善出现在多峰 case 上。比如两个物体有一定的 overlap(但又没有特别重合),这个时候 one-to-many+NMS 方法经常出现的情况是,除了两个物体分别出了一个框之外,在两个物体中间也出了一个框,这个框与前两个框的 IoU 不足以达到 NMS threshold,但置信度又比较高。这类典型的多峰问题在 POTO 中得到了较大的缓解。

丢弃Transformer,全卷积网络也可以实现E2E检测

Others

有些人可能比较关心训练时间,因为潜意识里在 dense prediction 上做 bipartite matching 应该是很慢的。然而实际上依赖于 scipy 对 linear_sum_assignment 的优化,实际训练时间仅仅下降了 10% 左右。

如果对这一时间依然敏感,可以用 topk(k=1)代替 bipartite matching;在 dense prediction 里 top1 实际上是 bipartite matching 的近似解 [8] 。相似地,k>1 的情况对应了 one-to-many 的一种新做法,研究者也对此做了一些工作,后续可能会放出来。

参考

如果有人感兴趣的话,可以在 YOLO 上去掉 NMS 尝试一下,可以接近 30mAP。

注意这里没有使用 DETR 的 CE+GIoU+L1 组合,而是直接采用 loss 本身(Focal+GIoU)。研究者认为这样更符合 DETR 用 loss 做 cost 的原意。

其实这里可以有一个脑洞留给大家,因为 cost 是不需要求导的,所以甚至是可以直接算 AP 当 cost 的。

侧面印证了分类和回归的冲突在检测任务上是显著的。

理由很简单,CrowdHuman 的遮挡问题太严重,center 区域经常完全被遮挡。

事实上加权几何平均数的负对数就是 CE+IoU Loss,加权算术平均数则没有明显的物理含义。

NoisyAnchor 在 assign 中采用了类似的公式,只不过采用的是 anchor IoU。

更具体来讲,top1(即 argmin)是 Hugarian Algorithm 只做第一次迭代的结果;由于在 dense prediction 下冲突会很少,一次迭代就已经逼近了最优匹配,这也是为什么 Hungarian Algorithm 这里实际运行很快。

 

dawei

【声明】:毕节站长网内容转载自互联网,其相关言论仅代表作者个人观点绝非权威,不代表本站立场。如您发现内容存在版权问题,请提交相关链接至邮箱:bqsm@foxmail.com,我们将及时予以处理。

您错过了