VATT: Transformers for Multimodal Self-Supervised Learning from Raw Video, Audio and Text

researchr

You are not signed in
Sign in
Sign up

Hassan Akbari, Liangzhe Yuan, Rui Qian, Wei-Hong Chuang, Shih-Fu Chang, Yin Cui, Boqing Gong. VATT: Transformers for Multimodal Self-Supervised Learning from Raw Video, Audio and Text. In Marc'Aurelio Ranzato, Alina Beygelzimer, Yann N. Dauphin, Percy Liang, Jennifer Wortman Vaughan, editors, Advances in Neural Information Processing Systems 34: Annual Conference on Neural Information Processing Systems 2021, NeurIPS 2021, December 6-14, 2021, virtual. pages 24206-24221, 2021. [doi]

@inproceedings{AkbariYQCCCG21,
  title = {VATT: Transformers for Multimodal Self-Supervised Learning from Raw Video, Audio and Text},
  author = {Hassan Akbari and Liangzhe Yuan and Rui Qian and Wei-Hong Chuang and Shih-Fu Chang and Yin Cui and Boqing Gong},
  year = {2021},
  url = {https://proceedings.neurips.cc/paper/2021/hash/cb3213ada48302953cb0f166464ab356-Abstract.html},
  researchr = {https://researchr.org/publication/AkbariYQCCCG21},
  cites = {0},
  citedby = {0},
  pages = {24206-24221},
  booktitle = {Advances in Neural Information Processing Systems 34: Annual Conference on Neural Information Processing Systems 2021, NeurIPS 2021, December 6-14, 2021, virtual},
  editor = {Marc'Aurelio Ranzato and Alina Beygelzimer and Yann N. Dauphin and Percy Liang and Jennifer Wortman Vaughan},
}

External Links

Cite Key

Statistics

PDF

Researchr

VATT: Transformers for Multimodal Self-Supervised Learning from Raw Video, Audio and Text