我们想回答一个更直接的问题:如果模型只有约 6M 参数,还能不能保留基础深度估计的跨场景泛化能力。随后利用 Depth Anything V2-L 生成的伪深度监督,将相对深度先验蒸馏到 TinyViM+DPT 构成的小模型中。主要研究方向为计算机视觉与多模态学习,关注单目深度估计、高效视觉模型、视觉语言模型及视觉基础模型的轻量化与端侧部署。
我们想回答一个更直接的问题:如果模型只有约 6M 参数,还能不能保留基础深度估计的跨场景泛化能力。随后利用 Depth Anything V2-L 生成的伪深度监督,将相对深度先验蒸馏到 TinyViM+DPT 构成的小模型中。主要研究方向为计算机视觉与多模态学习,关注单目深度估计、高效视觉模型、视觉语言模型及视觉基础模型的轻量化与端侧部署。