Incentivizing Temporal-Awareness in Egocentric Video Understanding Models
Researchers have introduced TimeThink, a new framework designed to help video large language models better process temporal information in long-form recordings. The system improves accuracy by identifying and verifying specific moments within a video sequence, addressing a common weakness in existing models that struggle to maintain context over time.
Covered by 2 sources · 6 articles
- AApple Machine Learning Blog↗Jul 9
- AarXiv CS.AI↗Harsh Goel, S P Sharan, Sahil Shah, Minkyu Choi, Joungbin An, Kristen Grauman, Sandeep P. ChinchaliJul 7
- AarXiv CS.AI↗Zhenkun Gao, Yicheng Bao, Jinlong Peng, Xueheng Li, Theo Huang, Bangwei Liu, Kunquan Li, Zhenye Gan, Tao Hu, Chengjun Xie, Mingqian Yang, Xuanhua He, Zhizhong Zhang, Xin Tan, Chengjie Wang, Yuan XieJul 7
- AarXiv CS.AI↗Youngkil Song, Yoonjae Baek, Dongwon Kim, Inho Kim, Dongkeun Kim, Suha KwakJul 7
- AarXiv CS.AI↗Yibin Liu, Yaxing Lyu, Daqi Gao, Zhixuan Liang, Weiliang Tang, Shilong Mu, Xiaokang Yang, Yao MuJul 8
- AarXiv CS.AI↗Handong Li, Longteng Guo, Zikang Liu, Dongze Hao, Yepeng Tang, Zijia Zhao, Jie Jiang, Zhiwei Jin, Chen Chen, Haonan Lu, Jing LiuJul 7