Mirasol3B: A Multimodal Autoregressive model for time-aligned and contextual modalities
Fuente:
arXiv
Salvato in:
| Autori principali: | Piergiovanni, AJ, Noble, Isaac, Kim, Dahun, Ryoo, Michael S., Gomes, Victor, Angelova, Anelia |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2023
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Whats in a Video: Factorized Autoregressive Decoding for Online Dense Video Captioning
di: Piergiovanni, AJ, et al.
Pubblicazione: (2024)
di: Piergiovanni, AJ, et al.
Pubblicazione: (2024)
Time-Scaling State-Space Models for Dense Video Captioning
di: Piergiovanni, AJ, et al.
Pubblicazione: (2025)
di: Piergiovanni, AJ, et al.
Pubblicazione: (2025)
VideoComp: Advancing Fine-Grained Compositional and Temporal Alignment in Video-Text Models
di: Kim, Dahun, et al.
Pubblicazione: (2025)
di: Kim, Dahun, et al.
Pubblicazione: (2025)
Unlocking Multi-Spectral Data for Multi-Modal Models with Guided Inputs and Chain-of-Thought Reasoning
di: Kim, Dahun, et al.
Pubblicazione: (2026)
di: Kim, Dahun, et al.
Pubblicazione: (2026)
Region-centric Image-Language Pretraining for Open-Vocabulary Detection
di: Kim, Dahun, et al.
Pubblicazione: (2023)
di: Kim, Dahun, et al.
Pubblicazione: (2023)
Zero-Shot Multi-Spectral Learning: Reimagining a Generalist Multimodal Gemini 2.5 Model for Remote Sensing Applications
di: Mallya, Ganesh, et al.
Pubblicazione: (2025)
di: Mallya, Ganesh, et al.
Pubblicazione: (2025)
Context-Adaptive Multi-Prompt Embedding with Large Language Models for Vision-Language Alignment
di: Kim, Dahun, et al.
Pubblicazione: (2025)
di: Kim, Dahun, et al.
Pubblicazione: (2025)
Understanding Long Videos with Multimodal Language Models
di: Ranasinghe, Kanchana, et al.
Pubblicazione: (2024)
di: Ranasinghe, Kanchana, et al.
Pubblicazione: (2024)
MINERVA-Cultural: A Benchmark for Cultural and Multilingual Long Video Reasoning
di: Singh, Darshan, et al.
Pubblicazione: (2026)
di: Singh, Darshan, et al.
Pubblicazione: (2026)
OmniBind: Teach to Build Unequal-Scale Modality Interaction for Omni-Bind of All
di: Lyu, Yuanhuiyi, et al.
Pubblicazione: (2024)
di: Lyu, Yuanhuiyi, et al.
Pubblicazione: (2024)
A Training-Free Style-aligned Image Generation with Scale-wise Autoregressive Model
di: Park, Jihun, et al.
Pubblicazione: (2025)
di: Park, Jihun, et al.
Pubblicazione: (2025)
Learning Visual Grounding from Generative Vision and Language Model
di: Wang, Shijie, et al.
Pubblicazione: (2024)
di: Wang, Shijie, et al.
Pubblicazione: (2024)
3D Open-Vocabulary Panoptic Segmentation with 2D-3D Vision-Language Distillation
di: Xiao, Zihao, et al.
Pubblicazione: (2024)
di: Xiao, Zihao, et al.
Pubblicazione: (2024)
Image Translation with Kernel Prediction Networks for Semantic Segmentation
di: Mata, Cristina, et al.
Pubblicazione: (2025)
di: Mata, Cristina, et al.
Pubblicazione: (2025)
Vision-aligned Latent Reasoning for Multi-modal Large Language Model
di: Jeon, Byungwoo, et al.
Pubblicazione: (2026)
di: Jeon, Byungwoo, et al.
Pubblicazione: (2026)
Model alignment using inter-modal bridges
di: Gholamzadeh, Ali, et al.
Pubblicazione: (2025)
di: Gholamzadeh, Ali, et al.
Pubblicazione: (2025)
VLA-Mark: A cross modal watermark for large vision-language alignment model
di: Liu, Shuliang, et al.
Pubblicazione: (2025)
di: Liu, Shuliang, et al.
Pubblicazione: (2025)
Taking Shortcuts for Categorical VQA Using Super Neurons
di: Musacchio, Pierre, et al.
Pubblicazione: (2026)
di: Musacchio, Pierre, et al.
Pubblicazione: (2026)
Context-Aware Input Orchestration for Video Inpainting
di: Kim, Hoyoung, et al.
Pubblicazione: (2024)
di: Kim, Hoyoung, et al.
Pubblicazione: (2024)
LieHMR: Autoregressive Human Mesh Recovery with $SO(3)$ Diffusion
di: Kim, Donghwan, et al.
Pubblicazione: (2025)
di: Kim, Donghwan, et al.
Pubblicazione: (2025)
MMSummary: Multimodal Summary Generation for Fetal Ultrasound Video
di: Guo, Xiaoqing, et al.
Pubblicazione: (2024)
di: Guo, Xiaoqing, et al.
Pubblicazione: (2024)
RAVEN: Real-time Autoregressive Video Extrapolation with Consistency-model GRPO
di: Lu, Yanzuo, et al.
Pubblicazione: (2026)
di: Lu, Yanzuo, et al.
Pubblicazione: (2026)
VicTR: Video-conditioned Text Representations for Activity Recognition
di: Kahatapitiya, Kumara, et al.
Pubblicazione: (2023)
di: Kahatapitiya, Kumara, et al.
Pubblicazione: (2023)
Language Repository for Long Video Understanding
di: Kahatapitiya, Kumara, et al.
Pubblicazione: (2024)
di: Kahatapitiya, Kumara, et al.
Pubblicazione: (2024)
DrivingGPT: Unifying Driving World Modeling and Planning with Multi-modal Autoregressive Transformers
di: Chen, Yuntao, et al.
Pubblicazione: (2024)
di: Chen, Yuntao, et al.
Pubblicazione: (2024)
Multi-visual modality micro drone-based structural damage detection
di: Agyemanga, Isaac Osei, et al.
Pubblicazione: (2025)
di: Agyemanga, Isaac Osei, et al.
Pubblicazione: (2025)
Too Many Frames, Not All Useful: Efficient Strategies for Long-Form Video QA
di: Park, Jongwoo, et al.
Pubblicazione: (2024)
di: Park, Jongwoo, et al.
Pubblicazione: (2024)
A re-calibration method for object detection with multi-modal alignment bias in autonomous driving
di: Song, Zhihang, et al.
Pubblicazione: (2024)
di: Song, Zhihang, et al.
Pubblicazione: (2024)
Exploring contextual modeling with linear complexity for point cloud segmentation
di: Chng, Yong Xien, et al.
Pubblicazione: (2024)
di: Chng, Yong Xien, et al.
Pubblicazione: (2024)
Can multimodal representation learning by alignment preserve modality-specific information?
di: Thoreau, Romain, et al.
Pubblicazione: (2025)
di: Thoreau, Romain, et al.
Pubblicazione: (2025)
Phantom: Subject-consistent video generation via cross-modal alignment
di: Liu, Lijie, et al.
Pubblicazione: (2025)
di: Liu, Lijie, et al.
Pubblicazione: (2025)
OmniMotion: Multimodal Motion Generation with Continuous Masked Autoregression
di: Li, Zhe, et al.
Pubblicazione: (2025)
di: Li, Zhe, et al.
Pubblicazione: (2025)
Multimodal Autoregressive Pre-training of Large Vision Encoders
di: Fini, Enrico, et al.
Pubblicazione: (2024)
di: Fini, Enrico, et al.
Pubblicazione: (2024)
VINO: Video-driven Invariance for Non-contextual Objects via Structural Prior Guided De-contextualization
di: Yeom, Seul-Ki, et al.
Pubblicazione: (2026)
di: Yeom, Seul-Ki, et al.
Pubblicazione: (2026)
Cross-modal Affinity-aligned Multimodal Learning Analytics for Predicting Student Collaboration Satisfaction in Game-Based Learning
di: Tsai, Wen-Hsin, et al.
Pubblicazione: (2026)
di: Tsai, Wen-Hsin, et al.
Pubblicazione: (2026)
Multi-view Structural Convolution Network for Domain-Invariant Point Cloud Recognition of Autonomous Vehicles
di: Kim, Younggun, et al.
Pubblicazione: (2025)
di: Kim, Younggun, et al.
Pubblicazione: (2025)
CoPT: Unsupervised Domain Adaptive Segmentation using Domain-Agnostic Text Embeddings
di: Mata, Cristina, et al.
Pubblicazione: (2025)
di: Mata, Cristina, et al.
Pubblicazione: (2025)
PathAR: Structure-First Autoregressive Synthesis of Multimodal Pathology Images
di: Zhang, Yuan, et al.
Pubblicazione: (2026)
di: Zhang, Yuan, et al.
Pubblicazione: (2026)
Autoregressive Appearance Prediction for 3D Gaussian Avatars
di: Steiner, Michael, et al.
Pubblicazione: (2026)
di: Steiner, Michael, et al.
Pubblicazione: (2026)
Masked Autoregressive Model for Weather Forecasting
di: Kim, Doyi, et al.
Pubblicazione: (2024)
di: Kim, Doyi, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Whats in a Video: Factorized Autoregressive Decoding for Online Dense Video Captioning
di: Piergiovanni, AJ, et al.
Pubblicazione: (2024) -
Time-Scaling State-Space Models for Dense Video Captioning
di: Piergiovanni, AJ, et al.
Pubblicazione: (2025) -
VideoComp: Advancing Fine-Grained Compositional and Temporal Alignment in Video-Text Models
di: Kim, Dahun, et al.
Pubblicazione: (2025) -
Unlocking Multi-Spectral Data for Multi-Modal Models with Guided Inputs and Chain-of-Thought Reasoning
di: Kim, Dahun, et al.
Pubblicazione: (2026) -
Region-centric Image-Language Pretraining for Open-Vocabulary Detection
di: Kim, Dahun, et al.
Pubblicazione: (2023)