ReMoRa: Multimodal Large Language Model based on Refined Motion Representation for Long-Video Understanding
Fuente:
arXiv
Salvato in:
| Autori principali: | Yashima, Daichi, Kurita, Shuhei, Oda, Yusuke, Sugiura, Komei |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
ABMAMBA: Multimodal Large Language Model with Aligned Hierarchical Bidirectional Scan for Efficient Video Captioning
di: Yashima, Daichi, et al.
Pubblicazione: (2026)
di: Yashima, Daichi, et al.
Pubblicazione: (2026)
HiFlow: Tokenization-Free Scale-Wise Autoregressive Policy Learning via Flow Matching
di: Yashima, Daichi, et al.
Pubblicazione: (2026)
di: Yashima, Daichi, et al.
Pubblicazione: (2026)
Open-Vocabulary Mobile Manipulation Based on Double Relaxed Contrastive Learning with Dense Labeling
di: Yashima, Daichi, et al.
Pubblicazione: (2024)
di: Yashima, Daichi, et al.
Pubblicazione: (2024)
MLLM-as-a-Judge Exhibits Model Preference Bias
di: Koyama, Shuitsu, et al.
Pubblicazione: (2026)
di: Koyama, Shuitsu, et al.
Pubblicazione: (2026)
HakushoBench: A Japanese Chart and Table VQA Benchmark from Governmental White Papers
di: Sugiura, Issa, et al.
Pubblicazione: (2026)
di: Sugiura, Issa, et al.
Pubblicazione: (2026)
JAMMEval: A Refined Collection of Japanese Benchmarks for Reliable VLM Evaluation
di: Sugiura, Issa, et al.
Pubblicazione: (2026)
di: Sugiura, Issa, et al.
Pubblicazione: (2026)
WAON: A Large-Scale Japanese Image-Text Dataset for Cultural Adaptation in Contrastive Vision-Language Models
di: Sugiura, Issa, et al.
Pubblicazione: (2025)
di: Sugiura, Issa, et al.
Pubblicazione: (2025)
NaiLIA: Multimodal Nail Design Retrieval Based on Dense Intent Descriptions and Palette Queries
di: Amemiya, Kanon, et al.
Pubblicazione: (2026)
di: Amemiya, Kanon, et al.
Pubblicazione: (2026)
Jagle: Building a Large-Scale Japanese Multimodal Post-Training Dataset for Vision-Language Models
di: Sugiura, Issa, et al.
Pubblicazione: (2026)
di: Sugiura, Issa, et al.
Pubblicazione: (2026)
Polos: Multimodal Metric Learning from Human Feedback for Image Captioning
di: Wada, Yuiga, et al.
Pubblicazione: (2024)
di: Wada, Yuiga, et al.
Pubblicazione: (2024)
Deep Space Weather Model: Long-Range Solar Flare Prediction from Multi-Wavelength Images
di: Nagashima, Shunya, et al.
Pubblicazione: (2025)
di: Nagashima, Shunya, et al.
Pubblicazione: (2025)
Evaluating Multimodal Large Language Models on Vertically Written Japanese Text
di: Sasagawa, Keito, et al.
Pubblicazione: (2025)
di: Sasagawa, Keito, et al.
Pubblicazione: (2025)
Task Success Prediction for Open-Vocabulary Manipulation Based on Multi-Level Aligned Representations
di: Goko, Miyu, et al.
Pubblicazione: (2024)
di: Goko, Miyu, et al.
Pubblicazione: (2024)
FLARE-SSM: Deep State Space Models with Influence-Balanced Loss for 72-Hour Solar Flare Prediction
di: Takagi, Yusuke, et al.
Pubblicazione: (2025)
di: Takagi, Yusuke, et al.
Pubblicazione: (2025)
Llama-Mimi: Exploring the Limits of Flattened Speech Language Modeling
di: Sugiura, Issa, et al.
Pubblicazione: (2025)
di: Sugiura, Issa, et al.
Pubblicazione: (2025)
Future Success Prediction in Open-Vocabulary Object Manipulation Tasks Based on End-Effector Trajectories
di: Kambara, Motonari, et al.
Pubblicazione: (2024)
di: Kambara, Motonari, et al.
Pubblicazione: (2024)
STATUS Bench: A Rigorous Benchmark for Evaluating Object State Understanding in Vision-Language Models
di: Ukai, Mahiro, et al.
Pubblicazione: (2025)
di: Ukai, Mahiro, et al.
Pubblicazione: (2025)
Cross3DVG: Cross-Dataset 3D Visual Grounding on Different RGB-D Scans
di: Miyanishi, Taiki, et al.
Pubblicazione: (2023)
di: Miyanishi, Taiki, et al.
Pubblicazione: (2023)
EC-Bench: Enumeration and Counting Benchmark for Ultra-Long Videos
di: Tsuchiya, Fumihiko, et al.
Pubblicazione: (2026)
di: Tsuchiya, Fumihiko, et al.
Pubblicazione: (2026)
Object Segmentation from Open-Vocabulary Manipulation Instructions Based on Optimal Transport Polygon Matching with Multimodal Foundation Models
di: Nishimura, Takayuki, et al.
Pubblicazione: (2024)
di: Nishimura, Takayuki, et al.
Pubblicazione: (2024)
Answerability Fields: Answerable Location Estimation via Diffusion Models
di: Azuma, Daichi, et al.
Pubblicazione: (2024)
di: Azuma, Daichi, et al.
Pubblicazione: (2024)
Map-based Modular Approach for Zero-shot Embodied Question Answering
di: Sakamoto, Koya, et al.
Pubblicazione: (2024)
di: Sakamoto, Koya, et al.
Pubblicazione: (2024)
AnoleVLA: Lightweight Vision-Language-Action Model with Deep State Space Models for Mobile Manipulation
di: Takagi, Yusuke, et al.
Pubblicazione: (2026)
di: Takagi, Yusuke, et al.
Pubblicazione: (2026)
Learning Compact Video Representations for Efficient Long-form Video Understanding in Large Multimodal Models
di: Chen, Yuxiao, et al.
Pubblicazione: (2026)
di: Chen, Yuxiao, et al.
Pubblicazione: (2026)
Understanding Long Videos with Multimodal Language Models
di: Ranasinghe, Kanchana, et al.
Pubblicazione: (2024)
di: Ranasinghe, Kanchana, et al.
Pubblicazione: (2024)
ZINA: Multimodal Fine-grained Hallucination Detection and Editing
di: Wada, Yuiga, et al.
Pubblicazione: (2025)
di: Wada, Yuiga, et al.
Pubblicazione: (2025)
Affordance RAG: Hierarchical Multimodal Retrieval with Affordance-Aware Embodied Memory for Mobile Manipulation
di: Korekata, Ryosuke, et al.
Pubblicazione: (2025)
di: Korekata, Ryosuke, et al.
Pubblicazione: (2025)
Self-ReS: Self-Reflection in Large Vision-Language Models for Long Video Understanding
di: Pereira, Joao, et al.
Pubblicazione: (2025)
di: Pereira, Joao, et al.
Pubblicazione: (2025)
Attention Lattice Adapter: Visual Explanation Generation for Visual Foundation Model
di: Hirano, Shinnosuke, et al.
Pubblicazione: (2025)
di: Hirano, Shinnosuke, et al.
Pubblicazione: (2025)
MoReFun: Past-Movement Guided Motion Representation Learning for Future Motion Prediction and Understanding
di: Shi, Junyu, et al.
Pubblicazione: (2024)
di: Shi, Junyu, et al.
Pubblicazione: (2024)
Vision Language Model-based Caption Evaluation Method Leveraging Visual Context Extraction
di: Maeda, Koki, et al.
Pubblicazione: (2024)
di: Maeda, Koki, et al.
Pubblicazione: (2024)
PhysQuantAgent: An Inference Pipeline of Mass Estimation for Vision-Language Models
di: Yokomizo, Hisayuki, et al.
Pubblicazione: (2026)
di: Yokomizo, Hisayuki, et al.
Pubblicazione: (2026)
FreeMotion: MoCap-Free Human Motion Synthesis with Multimodal Large Language Models
di: Zhang, Zhikai, et al.
Pubblicazione: (2024)
di: Zhang, Zhikai, et al.
Pubblicazione: (2024)
Cortical-SSM: A Deep State Space Model for EEG and ECoG Motor Imagery Decoding
di: Suzuki, Shuntaro, et al.
Pubblicazione: (2025)
di: Suzuki, Shuntaro, et al.
Pubblicazione: (2025)
DENEB: A Hallucination-Robust Automatic Evaluation Metric for Image Captioning
di: Matsuda, Kazuki, et al.
Pubblicazione: (2024)
di: Matsuda, Kazuki, et al.
Pubblicazione: (2024)
ReVision: Refining Video Diffusion with Explicit 3D Motion Modeling
di: Liu, Qihao, et al.
Pubblicazione: (2025)
di: Liu, Qihao, et al.
Pubblicazione: (2025)
ViMoNet: A Multimodal Vision-Language Framework for Human Behavior Understanding from Motion and Video
di: Gupta, Rajan Das, et al.
Pubblicazione: (2025)
di: Gupta, Rajan Das, et al.
Pubblicazione: (2025)
Stitch4D: Sparse Multi-Location 4D Urban Reconstruction via Spatio-Temporal Interpolation
di: Kogure, Hina, et al.
Pubblicazione: (2026)
di: Kogure, Hina, et al.
Pubblicazione: (2026)
Streaming Long Video Understanding with Large Language Models
di: Qian, Rui, et al.
Pubblicazione: (2024)
di: Qian, Rui, et al.
Pubblicazione: (2024)
CityNav: A Large-Scale Dataset for Real-World Aerial Navigation
di: Lee, Jungdae, et al.
Pubblicazione: (2024)
di: Lee, Jungdae, et al.
Pubblicazione: (2024)
Documenti analoghi
-
ABMAMBA: Multimodal Large Language Model with Aligned Hierarchical Bidirectional Scan for Efficient Video Captioning
di: Yashima, Daichi, et al.
Pubblicazione: (2026) -
HiFlow: Tokenization-Free Scale-Wise Autoregressive Policy Learning via Flow Matching
di: Yashima, Daichi, et al.
Pubblicazione: (2026) -
Open-Vocabulary Mobile Manipulation Based on Double Relaxed Contrastive Learning with Dense Labeling
di: Yashima, Daichi, et al.
Pubblicazione: (2024) -
MLLM-as-a-Judge Exhibits Model Preference Bias
di: Koyama, Shuitsu, et al.
Pubblicazione: (2026) -
HakushoBench: A Japanese Chart and Table VQA Benchmark from Governmental White Papers
di: Sugiura, Issa, et al.
Pubblicazione: (2026)