LITERATURE READING · 2025—2026

文献阅读时间线

根据本人周会 PPT 与同期保存的论文原文整理。记录阅读主题、核心认识以及研究方向的演进,不把资料推荐与真实阅读混在一起。

RGB-T 跟踪知识蒸馏Transformer 轻量化UAV 跟踪跨模态融合
29次阶段汇报
56篇归档 PDF
31份汇报 PPT

READING JOURNEY

从问题认识到方案验证

第 1 次 · 多模态视觉跟踪

从 OSTrack 到 RGB-T 模态交互

阅读 OSTrack、搜索区域与模板交互及跨模态蒸馏工作,建立单流跟踪、模板—搜索联合建模和 RGB-T 轻量化的基本问题框架。

核心文献:Joint Feature Learning and Relation Modeling for Tracking;Bridging Search Region Interaction with Template for RGB-T Tracking
第 2 次 · 知识蒸馏综述

教师、学生与 Teacher Assistant

梳理软目标、特征蒸馏、多教师、自蒸馏和跨模态蒸馏,认识到教师过强并不必然带来更好的学生,模型能力差距本身需要被管理。

核心文献:知识蒸馏研究综述;Improved Knowledge Distillation via Teacher Assistant
第 3 次 · 跨模态蒸馏

RGB-T 跟踪中的四类蒸馏路线

对比跨模态蒸馏、双流到单流、耦合蒸馏和多模态跟踪蒸馏,重点观察教师结构、模态知识传递位置与学生效率。

核心文献:Efficient RGB-T Tracking via Cross-Modality Distillation;Coupled Knowledge Distillation;TransCMD
第 4 次 · 高效跟踪框架

分层 ViT 与统一跟踪结构

从 HiViT 的层次表示和结构效率出发,横向调研 SUTrack、SeqTrack、SDSTrack、CMD 等模型,为 Teacher—TA—Student 跟踪框架选型。

核心文献:HiViT: A Simpler and More Efficient Design of Hierarchical Vision Transformer
第 5 次 · 实现与复现

教师代理蒸馏的工程问题

评估 SUTrack 不同规模模型,实际遇到 CKD 代码复现、特征维度对齐、权重迁移和 logit 对齐问题,研究从论文理解进入代码验证阶段。

研究进展:SUTrack L384 / B224 / L224 评估与蒸馏实现
第 6 次 · 非对称层数蒸馏

MixFormerV2 的渐进深度剪枝

关注教师与学生层数不一致时的知识传递,研究由深到浅的渐进层削减,并比较比例对齐、前段对齐与后段对齐策略。

核心文献:MixFormerV2: Efficient Fully Transformer Tracking
第 8 次 · 层次不对齐

跨层复习与 ViT 特征蒸馏

Knowledge Review 用注意力融合多个层次,ViTKD 则区分浅层模仿与深层生成,说明层间语义差异需要差异化损失,而非机械一一对齐。

核心文献:Distilling Knowledge via Knowledge Review;ViTKD
第 9—10 次 · 压缩方案细化

跨阶段、跨头与移动端增强

从 TransKD 的多尺度跨阶段融合,扩展到深度互学习、跨层跨头蒸馏、MobileIE 重参数化,以及面向超小模型的交叉蒸馏。

核心文献:TransKD;Deep Mutual Learning;MobileIE;Put Teacher in Student’s Shoes
第 11 次 · 红外与可见光融合

FreeFusion 的跨重建学习

分析无 GT 融合、模态领域差异与高层语义不匹配,通过 CTIM 与 TQM 理解跨任务交互;进一步思考文本提示和双分支互学习。

核心文献:FreeFusion: Infrared and Visible Image Fusion via Cross Reconstruction Learning
第 13—14 次 · 实验推进

双分支蒸馏与模态互学习

并行验证阶段随机替换蒸馏和 KL 互学习,引入模态一致性损失与权重平衡,同时记录显存限制、训练节奏和 RGB/TIR 权重偏移。

研究进展:OSTrack-RGBT 12→4 蒸馏与模态互学习
第 15 次 · 边缘模型蒸馏

CustomKD:让教师适配学生

面对大型视觉基础模型与边缘模型的架构鸿沟,不再只要求学生模仿教师,而是先生成学生可理解的定制教师特征。

核心文献:CustomKD: Customizing Large Vision Foundation for Edge Model Improvement via Knowledge Distillation
第 16 次 · 层自适应 ViT

用相似度定位冗余层

分析轻量 ViT 深层特征饱和现象,通过选择模块动态保留有效层,为“固定削层”转向“样本自适应计算”提供依据。

核心文献:Similarity-Guided Layer-Adaptive Vision Transformer for UAV Tracking
第 17 次 · 遮挡鲁棒跟踪

难度感知的动态特征蒸馏

研究 Cox 过程遮挡掩码与 AFKD:难样本加强教师模仿、易样本减少依赖,并结合自身 12→11 分阶段削层实验思考训练路径。

核心文献:Learning Occlusion-Robust Vision Transformers for Real-Time UAV Tracking
第 18 次 · 动态块激活

多教师与视角不变 UAV 跟踪

以块稀疏约束控制 Transformer 激活数量,并利用多个不同骨干教师传递互补知识,进一步探索按输入动态分配算力。

核心文献:Learning an Adaptive and View-Invariant Vision Transformer for Real-Time UAV Tracking
第 19 次 · 检测头蒸馏

CrossKD 缓解监督目标冲突

学生中间特征接入教师检测头形成跨头预测,在教师软目标与真实标签之间建立桥梁,避免直接预测模仿带来的优化冲突。

核心文献:CrossKD: Cross-Head Knowledge Distillation for Object Detection
第 20 次 · 分阶段压缩实验

三模型蒸馏与 12→9→6 路径

比较直接 12→6 与两阶段 12→9→6 的成本和稳定性,重点权衡训练轮次、资源消耗以及阶段参数衔接。

相关文献:Exploring Dynamic Transformer for Efficient Object Tracking;TLSH-MOT
第 21 次 · 自适应旁路

ABTrack 的块跳过与维度剪枝

通过旁路决策模块跳过非关键 Transformer 块,并结合局部排序剪枝压缩 token 表征维度,继续研究速度—精度权衡。

核心文献:ABTrack: Adaptive Bypass Transformer for Efficient Visual Tracking
第 22 次 · 鲁棒特征增强

GCTrack 的高斯增强与分类校正

针对局部窗口注意力的全局信息不足、噪声干扰和形变定位误差,在搜索分支加入高斯滤波增强并校正分类头。

核心文献:GCTrack(Signal, Image and Video Processing 2025)
第 23 次 · 轻量关系建模

FERMT 的分层注意力

通过分层注意力架构和双注意力预处理,同时减少计算量与提升特征质量,将“特征提取—关系建模”放在统一轻量框架中审视。

核心文献:Exploring the Feature Extraction and Relation Modeling for Light-Weight Transformer Tracking
第 24 次 · 从易到难蒸馏

CIKD 的局部性传递

先在 ALI 阶段模仿教师自注意力、学习局部性,再在 LM 阶段蒸馏 logit 与高层语义,理解小数据集上分阶段教学的价值。

核心文献:Patient Teacher Can Impart Locality to Improve Lightweight Vision Transformer on Small Dataset
第 25 次 · RGB-T 模态去偏

DMD:特征与决策双级校正

用红外感知适配器和交叉融合适配器缓解特征偏差,再通过响应解耦蒸馏对齐正负响应区域,回到 RGB-T 跟踪最初的模态失衡问题。

核心文献:Dual-Level Modality De-Biasing for RGB-T Tracking
第 26 次 · 跨域与跨任务融合

CDTFusion:同时跨越模态域与任务鸿沟

围绕红外—可见光融合中的跨域特征差异和融合—分割任务鸿沟,梳理 SITS 的全局—局部域对齐,以及 TIQM 如何让高层语义反向指导融合。

核心文献:CDTFusion: Crossing Domain and Task for Infrared and Visible Image Fusion
第 27 次 · 任务特定自蒸馏

FARTrack:轨迹令牌蒸馏与帧间自回归稀疏化

只蒸馏与跟踪任务直接相关的轨迹令牌,并利用跨帧注意力对多模板序列进行稀疏化,减少人工师生层对和逐帧重复计算。

核心文献:FARTrack(ICLR 2026)
第 28 次 · 解耦记忆与动态状态

Uni-MDTrack:参数高效的全模态时空跟踪

通过 MCP 压缩长期记忆并注入骨干,通过 DSF 从纯搜索区域捕捉连续动态状态;同时复盘个人 12→9、12→8、12→6 等削层实验的速度—精度变化。

核心文献:Uni-MDTrack: Learning Decoupled Memory and Dynamic States for Parameter-Efficient Visual Tracking in All Modality
第 29 次 · Token 压缩

面向视觉跟踪的自适应 Token 压缩框架

ATC 保留关键 token 并合并冗余信息,HIBlock 通过模板—搜索双向交互恢复压缩后的关系建模能力;进一步对照个人不同压缩比例下的 PR、FPS 与 MACs。

核心文献:An Efficient Token Compression Framework for Visual Object Tracking(CVPR 2026)