READING JOURNEY
从问题认识到方案验证
从 OSTrack 到 RGB-T 模态交互
阅读 OSTrack、搜索区域与模板交互及跨模态蒸馏工作,建立单流跟踪、模板—搜索联合建模和 RGB-T 轻量化的基本问题框架。
核心文献:Joint Feature Learning and Relation Modeling for Tracking;Bridging Search Region Interaction with Template for RGB-T Tracking教师、学生与 Teacher Assistant
梳理软目标、特征蒸馏、多教师、自蒸馏和跨模态蒸馏,认识到教师过强并不必然带来更好的学生,模型能力差距本身需要被管理。
核心文献:知识蒸馏研究综述;Improved Knowledge Distillation via Teacher AssistantRGB-T 跟踪中的四类蒸馏路线
对比跨模态蒸馏、双流到单流、耦合蒸馏和多模态跟踪蒸馏,重点观察教师结构、模态知识传递位置与学生效率。
核心文献:Efficient RGB-T Tracking via Cross-Modality Distillation;Coupled Knowledge Distillation;TransCMD分层 ViT 与统一跟踪结构
从 HiViT 的层次表示和结构效率出发,横向调研 SUTrack、SeqTrack、SDSTrack、CMD 等模型,为 Teacher—TA—Student 跟踪框架选型。
核心文献:HiViT: A Simpler and More Efficient Design of Hierarchical Vision Transformer教师代理蒸馏的工程问题
评估 SUTrack 不同规模模型,实际遇到 CKD 代码复现、特征维度对齐、权重迁移和 logit 对齐问题,研究从论文理解进入代码验证阶段。
研究进展:SUTrack L384 / B224 / L224 评估与蒸馏实现MixFormerV2 的渐进深度剪枝
关注教师与学生层数不一致时的知识传递,研究由深到浅的渐进层削减,并比较比例对齐、前段对齐与后段对齐策略。
核心文献:MixFormerV2: Efficient Fully Transformer Tracking跨层复习与 ViT 特征蒸馏
Knowledge Review 用注意力融合多个层次,ViTKD 则区分浅层模仿与深层生成,说明层间语义差异需要差异化损失,而非机械一一对齐。
核心文献:Distilling Knowledge via Knowledge Review;ViTKD跨阶段、跨头与移动端增强
从 TransKD 的多尺度跨阶段融合,扩展到深度互学习、跨层跨头蒸馏、MobileIE 重参数化,以及面向超小模型的交叉蒸馏。
核心文献:TransKD;Deep Mutual Learning;MobileIE;Put Teacher in Student’s ShoesFreeFusion 的跨重建学习
分析无 GT 融合、模态领域差异与高层语义不匹配,通过 CTIM 与 TQM 理解跨任务交互;进一步思考文本提示和双分支互学习。
核心文献:FreeFusion: Infrared and Visible Image Fusion via Cross Reconstruction Learning双分支蒸馏与模态互学习
并行验证阶段随机替换蒸馏和 KL 互学习,引入模态一致性损失与权重平衡,同时记录显存限制、训练节奏和 RGB/TIR 权重偏移。
研究进展:OSTrack-RGBT 12→4 蒸馏与模态互学习CustomKD:让教师适配学生
面对大型视觉基础模型与边缘模型的架构鸿沟,不再只要求学生模仿教师,而是先生成学生可理解的定制教师特征。
核心文献:CustomKD: Customizing Large Vision Foundation for Edge Model Improvement via Knowledge Distillation用相似度定位冗余层
分析轻量 ViT 深层特征饱和现象,通过选择模块动态保留有效层,为“固定削层”转向“样本自适应计算”提供依据。
核心文献:Similarity-Guided Layer-Adaptive Vision Transformer for UAV Tracking难度感知的动态特征蒸馏
研究 Cox 过程遮挡掩码与 AFKD:难样本加强教师模仿、易样本减少依赖,并结合自身 12→11 分阶段削层实验思考训练路径。
核心文献:Learning Occlusion-Robust Vision Transformers for Real-Time UAV Tracking多教师与视角不变 UAV 跟踪
以块稀疏约束控制 Transformer 激活数量,并利用多个不同骨干教师传递互补知识,进一步探索按输入动态分配算力。
核心文献:Learning an Adaptive and View-Invariant Vision Transformer for Real-Time UAV TrackingCrossKD 缓解监督目标冲突
学生中间特征接入教师检测头形成跨头预测,在教师软目标与真实标签之间建立桥梁,避免直接预测模仿带来的优化冲突。
核心文献:CrossKD: Cross-Head Knowledge Distillation for Object Detection三模型蒸馏与 12→9→6 路径
比较直接 12→6 与两阶段 12→9→6 的成本和稳定性,重点权衡训练轮次、资源消耗以及阶段参数衔接。
相关文献:Exploring Dynamic Transformer for Efficient Object Tracking;TLSH-MOTABTrack 的块跳过与维度剪枝
通过旁路决策模块跳过非关键 Transformer 块,并结合局部排序剪枝压缩 token 表征维度,继续研究速度—精度权衡。
核心文献:ABTrack: Adaptive Bypass Transformer for Efficient Visual TrackingGCTrack 的高斯增强与分类校正
针对局部窗口注意力的全局信息不足、噪声干扰和形变定位误差,在搜索分支加入高斯滤波增强并校正分类头。
核心文献:GCTrack(Signal, Image and Video Processing 2025)FERMT 的分层注意力
通过分层注意力架构和双注意力预处理,同时减少计算量与提升特征质量,将“特征提取—关系建模”放在统一轻量框架中审视。
核心文献:Exploring the Feature Extraction and Relation Modeling for Light-Weight Transformer TrackingCIKD 的局部性传递
先在 ALI 阶段模仿教师自注意力、学习局部性,再在 LM 阶段蒸馏 logit 与高层语义,理解小数据集上分阶段教学的价值。
核心文献:Patient Teacher Can Impart Locality to Improve Lightweight Vision Transformer on Small DatasetDMD:特征与决策双级校正
用红外感知适配器和交叉融合适配器缓解特征偏差,再通过响应解耦蒸馏对齐正负响应区域,回到 RGB-T 跟踪最初的模态失衡问题。
核心文献:Dual-Level Modality De-Biasing for RGB-T TrackingCDTFusion:同时跨越模态域与任务鸿沟
围绕红外—可见光融合中的跨域特征差异和融合—分割任务鸿沟,梳理 SITS 的全局—局部域对齐,以及 TIQM 如何让高层语义反向指导融合。
核心文献:CDTFusion: Crossing Domain and Task for Infrared and Visible Image FusionFARTrack:轨迹令牌蒸馏与帧间自回归稀疏化
只蒸馏与跟踪任务直接相关的轨迹令牌,并利用跨帧注意力对多模板序列进行稀疏化,减少人工师生层对和逐帧重复计算。
核心文献:FARTrack(ICLR 2026)Uni-MDTrack:参数高效的全模态时空跟踪
通过 MCP 压缩长期记忆并注入骨干,通过 DSF 从纯搜索区域捕捉连续动态状态;同时复盘个人 12→9、12→8、12→6 等削层实验的速度—精度变化。
核心文献:Uni-MDTrack: Learning Decoupled Memory and Dynamic States for Parameter-Efficient Visual Tracking in All Modality面向视觉跟踪的自适应 Token 压缩框架
ATC 保留关键 token 并合并冗余信息,HIBlock 通过模板—搜索双向交互恢复压缩后的关系建模能力;进一步对照个人不同压缩比例下的 PR、FPS 与 MACs。
核心文献:An Efficient Token Compression Framework for Visual Object Tracking(CVPR 2026)