RB-FT: Rationale-Bootstrapped Fine-Tuning for Video Classification

Published in arXiv preprint, 2025

RB-FT addresses the rationale gap between complex spatio-temporal video content and abstract domain-specific labels. It first trains a vision-language model on its own detailed video rationales, then fine-tunes it on task labels, improving adaptation without requiring new human annotations.

Access paper

Recommended citation: Meilong Xu, Di Fu, Jiaxing Zhang, Gong Yu, Jiayu Zheng, Xiaoling Hu, Dongdi Zhao, Feiyang Li, Chao Chen, Yong Cao. 2025. RB-FT: Rationale-Bootstrapped Fine-Tuning for Video Classification. arXiv:2511.15923.

Recommended citation: Meilong Xu, Di Fu, Jiaxing Zhang, Gong Yu, Jiayu Zheng, Xiaoling Hu, Dongdi Zhao, Feiyang Li, Chao Chen, Yong Cao. 2025. RB-FT: Rationale-Bootstrapped Fine-Tuning for Video Classification. arXiv:2511.15923. https://arxiv.org/abs/2511.15923