ABMAMBA: Multimodal Large Language Model with Aligned Hierarchical Bidirectional Scan for Efficient Video Captioning
Fuente:
arXiv
Salvato in:
| Autori principali: | Yashima, Daichi, Kurita, Shuhei, Oda, Yusuke, Suzuki, Shuntaro, Otsuki, Seitaro, Sugiura, Komei |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
ReMoRa: Multimodal Large Language Model based on Refined Motion Representation for Long-Video Understanding
di: Yashima, Daichi, et al.
Pubblicazione: (2026)
di: Yashima, Daichi, et al.
Pubblicazione: (2026)
NaiLIA: Multimodal Nail Design Retrieval Based on Dense Intent Descriptions and Palette Queries
di: Amemiya, Kanon, et al.
Pubblicazione: (2026)
di: Amemiya, Kanon, et al.
Pubblicazione: (2026)
Task Success Prediction for Open-Vocabulary Manipulation Based on Multi-Level Aligned Representations
di: Goko, Miyu, et al.
Pubblicazione: (2024)
di: Goko, Miyu, et al.
Pubblicazione: (2024)
LLM-Free Image Captioning Evaluation in Reference-Flexible Settings
di: Hirano, Shinnosuke, et al.
Pubblicazione: (2025)
di: Hirano, Shinnosuke, et al.
Pubblicazione: (2025)
HiFlow: Tokenization-Free Scale-Wise Autoregressive Policy Learning via Flow Matching
di: Yashima, Daichi, et al.
Pubblicazione: (2026)
di: Yashima, Daichi, et al.
Pubblicazione: (2026)
VELA: An LLM-Hybrid-as-a-Judge Approach for Evaluating Long Image Captions
di: Matsuda, Kazuki, et al.
Pubblicazione: (2025)
di: Matsuda, Kazuki, et al.
Pubblicazione: (2025)
Open-Vocabulary Mobile Manipulation Based on Double Relaxed Contrastive Learning with Dense Labeling
di: Yashima, Daichi, et al.
Pubblicazione: (2024)
di: Yashima, Daichi, et al.
Pubblicazione: (2024)
MLLM-as-a-Judge Exhibits Model Preference Bias
di: Koyama, Shuitsu, et al.
Pubblicazione: (2026)
di: Koyama, Shuitsu, et al.
Pubblicazione: (2026)
HakushoBench: A Japanese Chart and Table VQA Benchmark from Governmental White Papers
di: Sugiura, Issa, et al.
Pubblicazione: (2026)
di: Sugiura, Issa, et al.
Pubblicazione: (2026)
Polos: Multimodal Metric Learning from Human Feedback for Image Captioning
di: Wada, Yuiga, et al.
Pubblicazione: (2024)
di: Wada, Yuiga, et al.
Pubblicazione: (2024)
WAON: A Large-Scale Japanese Image-Text Dataset for Cultural Adaptation in Contrastive Vision-Language Models
di: Sugiura, Issa, et al.
Pubblicazione: (2025)
di: Sugiura, Issa, et al.
Pubblicazione: (2025)
Cortical-SSM: A Deep State Space Model for EEG and ECoG Motor Imagery Decoding
di: Suzuki, Shuntaro, et al.
Pubblicazione: (2025)
di: Suzuki, Shuntaro, et al.
Pubblicazione: (2025)
Layer-Wise Relevance Propagation with Conservation Property for ResNet
di: Otsuki, Seitaro, et al.
Pubblicazione: (2024)
di: Otsuki, Seitaro, et al.
Pubblicazione: (2024)
JAMMEval: A Refined Collection of Japanese Benchmarks for Reliable VLM Evaluation
di: Sugiura, Issa, et al.
Pubblicazione: (2026)
di: Sugiura, Issa, et al.
Pubblicazione: (2026)
Cross3DVG: Cross-Dataset 3D Visual Grounding on Different RGB-D Scans
di: Miyanishi, Taiki, et al.
Pubblicazione: (2023)
di: Miyanishi, Taiki, et al.
Pubblicazione: (2023)
Jagle: Building a Large-Scale Japanese Multimodal Post-Training Dataset for Vision-Language Models
di: Sugiura, Issa, et al.
Pubblicazione: (2026)
di: Sugiura, Issa, et al.
Pubblicazione: (2026)
DENEB: A Hallucination-Robust Automatic Evaluation Metric for Image Captioning
di: Matsuda, Kazuki, et al.
Pubblicazione: (2024)
di: Matsuda, Kazuki, et al.
Pubblicazione: (2024)
Evaluating Multimodal Large Language Models on Vertically Written Japanese Text
di: Sasagawa, Keito, et al.
Pubblicazione: (2025)
di: Sasagawa, Keito, et al.
Pubblicazione: (2025)
Affordance RAG: Hierarchical Multimodal Retrieval with Affordance-Aware Embodied Memory for Mobile Manipulation
di: Korekata, Ryosuke, et al.
Pubblicazione: (2025)
di: Korekata, Ryosuke, et al.
Pubblicazione: (2025)
FLARE-SSM: Deep State Space Models with Influence-Balanced Loss for 72-Hour Solar Flare Prediction
di: Takagi, Yusuke, et al.
Pubblicazione: (2025)
di: Takagi, Yusuke, et al.
Pubblicazione: (2025)
Vision Language Model-based Caption Evaluation Method Leveraging Visual Context Extraction
di: Maeda, Koki, et al.
Pubblicazione: (2024)
di: Maeda, Koki, et al.
Pubblicazione: (2024)
Future Success Prediction in Open-Vocabulary Object Manipulation Tasks Based on End-Effector Trajectories
di: Kambara, Motonari, et al.
Pubblicazione: (2024)
di: Kambara, Motonari, et al.
Pubblicazione: (2024)
Deep Space Weather Model: Long-Range Solar Flare Prediction from Multi-Wavelength Images
di: Nagashima, Shunya, et al.
Pubblicazione: (2025)
di: Nagashima, Shunya, et al.
Pubblicazione: (2025)
Llama-Mimi: Exploring the Limits of Flattened Speech Language Modeling
di: Sugiura, Issa, et al.
Pubblicazione: (2025)
di: Sugiura, Issa, et al.
Pubblicazione: (2025)
Object Segmentation from Open-Vocabulary Manipulation Instructions Based on Optimal Transport Polygon Matching with Multimodal Foundation Models
di: Nishimura, Takayuki, et al.
Pubblicazione: (2024)
di: Nishimura, Takayuki, et al.
Pubblicazione: (2024)
ZINA: Multimodal Fine-grained Hallucination Detection and Editing
di: Wada, Yuiga, et al.
Pubblicazione: (2025)
di: Wada, Yuiga, et al.
Pubblicazione: (2025)
Answerability Fields: Answerable Location Estimation via Diffusion Models
di: Azuma, Daichi, et al.
Pubblicazione: (2024)
di: Azuma, Daichi, et al.
Pubblicazione: (2024)
Map-based Modular Approach for Zero-shot Embodied Question Answering
di: Sakamoto, Koya, et al.
Pubblicazione: (2024)
di: Sakamoto, Koya, et al.
Pubblicazione: (2024)
AnoleVLA: Lightweight Vision-Language-Action Model with Deep State Space Models for Mobile Manipulation
di: Takagi, Yusuke, et al.
Pubblicazione: (2026)
di: Takagi, Yusuke, et al.
Pubblicazione: (2026)
EC-Bench: Enumeration and Counting Benchmark for Ultra-Long Videos
di: Tsuchiya, Fumihiko, et al.
Pubblicazione: (2026)
di: Tsuchiya, Fumihiko, et al.
Pubblicazione: (2026)
Attention Lattice Adapter: Visual Explanation Generation for Visual Foundation Model
di: Hirano, Shinnosuke, et al.
Pubblicazione: (2025)
di: Hirano, Shinnosuke, et al.
Pubblicazione: (2025)
Stitch4D: Sparse Multi-Location 4D Urban Reconstruction via Spatio-Temporal Interpolation
di: Kogure, Hina, et al.
Pubblicazione: (2026)
di: Kogure, Hina, et al.
Pubblicazione: (2026)
CityNav: A Large-Scale Dataset for Real-World Aerial Navigation
di: Lee, Jungdae, et al.
Pubblicazione: (2024)
di: Lee, Jungdae, et al.
Pubblicazione: (2024)
DM2RM: Dual-Mode Multimodal Ranking for Target Objects and Receptacles Based on Open-Vocabulary Instructions
di: Korekata, Ryosuke, et al.
Pubblicazione: (2024)
di: Korekata, Ryosuke, et al.
Pubblicazione: (2024)
LongCaptioning: Unlocking the Power of Long Video Caption Generation in Large Multimodal Models
di: Wei, Hongchen, et al.
Pubblicazione: (2025)
di: Wei, Hongchen, et al.
Pubblicazione: (2025)
STATUS Bench: A Rigorous Benchmark for Evaluating Object State Understanding in Vision-Language Models
di: Ukai, Mahiro, et al.
Pubblicazione: (2025)
di: Ukai, Mahiro, et al.
Pubblicazione: (2025)
GeoProg3D: Compositional Visual Reasoning for City-Scale 3D Language Fields
di: Yasuki, Shunsuke, et al.
Pubblicazione: (2025)
di: Yasuki, Shunsuke, et al.
Pubblicazione: (2025)
PhysQuantAgent: An Inference Pipeline of Mass Estimation for Vision-Language Models
di: Yokomizo, Hisayuki, et al.
Pubblicazione: (2026)
di: Yokomizo, Hisayuki, et al.
Pubblicazione: (2026)
E3VS-Bench: A Benchmark for Viewpoint-Dependent Active Perception in 3D Gaussian Splatting Scenes
di: Sakamoto, Koya, et al.
Pubblicazione: (2026)
di: Sakamoto, Koya, et al.
Pubblicazione: (2026)
HAVEN: Hierarchically Aligned Multimodal Benchmark for Unified Video Understanding
di: Shi, Mengqi, et al.
Pubblicazione: (2026)
di: Shi, Mengqi, et al.
Pubblicazione: (2026)
Documenti analoghi
-
ReMoRa: Multimodal Large Language Model based on Refined Motion Representation for Long-Video Understanding
di: Yashima, Daichi, et al.
Pubblicazione: (2026) -
NaiLIA: Multimodal Nail Design Retrieval Based on Dense Intent Descriptions and Palette Queries
di: Amemiya, Kanon, et al.
Pubblicazione: (2026) -
Task Success Prediction for Open-Vocabulary Manipulation Based on Multi-Level Aligned Representations
di: Goko, Miyu, et al.
Pubblicazione: (2024) -
LLM-Free Image Captioning Evaluation in Reference-Flexible Settings
di: Hirano, Shinnosuke, et al.
Pubblicazione: (2025) -
HiFlow: Tokenization-Free Scale-Wise Autoregressive Policy Learning via Flow Matching
di: Yashima, Daichi, et al.
Pubblicazione: (2026)