D
Data
Text
A Multimodal Textbook for Vision-Language Pretraining Wenqi Zhang1 * Hang Zhang2 Xin Li2, † Jiashuo
Introduces a video-centric multimodal 'textbook' corpus for Vision-Language Model (VLM) pretraining. Motivated by the low knowledge density and loose image-text coupling of web-crawled interleaved co…