Salta al contenuto
Universidad del Mar SIBUMAR Descubridor Institucional UMAR
  • Inicio
  • Búsqueda avanzada
  • Explorar
  • Entra
    • English
    • Deutsch
    • Español
    • Français
    • Italiano
Avanzata
  • Next Token Prediction Towards Multimodal Intelligence: A Comprehensive Survey
Copertina

Next Token Prediction Towards Multimodal Intelligence: A Comprehensive Survey

Fuente: arXiv
Salvato in:
Dettagli Bibliografici
Autori principali: Chen, Liang, Wang, Zekun, Ren, Shuhuai, Li, Lei, Zhao, Haozhe, Li, Yunshui, Cai, Zefan, Guo, Hongcheng, Zhang, Lei, Xiong, Yizhe, Zhang, Yichi, Wu, Ruoyu, Dong, Qingxiu, Zhang, Ge, Yang, Jian, Meng, Lingwei, Hu, Shujie, Chen, Yulong, Lin, Junyang, Bai, Shuai, Vlachos, Andreas, Tan, Xu, Zhang, Minjia, Xiao, Wen, Yee, Aaron, Liu, Tianyu, Chang, Baobao
Natura: Preprint
Pubblicazione: 2024
Soggetti:
Computation and Language
Artificial Intelligence
Computer Vision and Pattern Recognition
Machine Learning
Multimedia
Audio and Speech Processing
Accesso online:
Acceder al recurso
Tags: Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
  • Citazione
  • Invia SMS
  • Invia email
  • Stampa
  • Esporta il record
    • Esporta a RefWorks
    • Esporta a EndNoteWeb
    • Esporta a EndNote
  • Aggiungi alla lista
  • PLink permanente
  • Posseduto
  • Descrizione
  • Commenti
  • Documenti analoghi
  • MARC21

Accesso online

https://arxiv.org/abs/2412.18619

Documenti analoghi

  • PCA-Bench: Evaluating Multimodal Large Language Models in Perception-Cognition-Action Chain
    di: Chen, Liang, et al.
    Pubblicazione: (2024)
  • A Spark of Vision-Language Intelligence: 2-Dimensional Autoregressive Transformer for Efficient Finegrained Image Generation
    di: Chen, Liang, et al.
    Pubblicazione: (2024)
  • An Image is Worth 1/2 Tokens After Layer 2: Plug-and-Play Inference Acceleration for Large Vision-Language Models
    di: Chen, Liang, et al.
    Pubblicazione: (2024)
  • Looking Beyond Text: Reducing Language bias in Large Vision-Language Models via Multimodal Dual-Attention and Soft-Image Guidance
    di: Zhao, Haozhe, et al.
    Pubblicazione: (2024)
  • Next Tokens Denoising for Speech Synthesis
    di: Liu, Yanqing, et al.
    Pubblicazione: (2025)
Universidad del Mar
Universidad del MarSistema Bibliotecario de la Universidad del MarDescubridor Institucional UMARImplementación y desarrollo: Mtro. Carlos Alonso Albores Pérez
InicioBúsqueda avanzadaExplorar
Visitas al Descubridor: 33,245© 2026 Universidad del Mar