ABMAMBA: Multimodal Large Language Model with Aligned Hierarchical Bidirectional Scan for Efficient Video Captioning
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Yashima, Daichi, Kurita, Shuhei, Oda, Yusuke, Suzuki, Shuntaro, Otsuki, Seitaro, Sugiura, Komei |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
ReMoRa: Multimodal Large Language Model based on Refined Motion Representation for Long-Video Understanding
par: Yashima, Daichi, et autres
Publié: (2026)
par: Yashima, Daichi, et autres
Publié: (2026)
NaiLIA: Multimodal Nail Design Retrieval Based on Dense Intent Descriptions and Palette Queries
par: Amemiya, Kanon, et autres
Publié: (2026)
par: Amemiya, Kanon, et autres
Publié: (2026)
Task Success Prediction for Open-Vocabulary Manipulation Based on Multi-Level Aligned Representations
par: Goko, Miyu, et autres
Publié: (2024)
par: Goko, Miyu, et autres
Publié: (2024)
LLM-Free Image Captioning Evaluation in Reference-Flexible Settings
par: Hirano, Shinnosuke, et autres
Publié: (2025)
par: Hirano, Shinnosuke, et autres
Publié: (2025)
HiFlow: Tokenization-Free Scale-Wise Autoregressive Policy Learning via Flow Matching
par: Yashima, Daichi, et autres
Publié: (2026)
par: Yashima, Daichi, et autres
Publié: (2026)
VELA: An LLM-Hybrid-as-a-Judge Approach for Evaluating Long Image Captions
par: Matsuda, Kazuki, et autres
Publié: (2025)
par: Matsuda, Kazuki, et autres
Publié: (2025)
Open-Vocabulary Mobile Manipulation Based on Double Relaxed Contrastive Learning with Dense Labeling
par: Yashima, Daichi, et autres
Publié: (2024)
par: Yashima, Daichi, et autres
Publié: (2024)
MLLM-as-a-Judge Exhibits Model Preference Bias
par: Koyama, Shuitsu, et autres
Publié: (2026)
par: Koyama, Shuitsu, et autres
Publié: (2026)
HakushoBench: A Japanese Chart and Table VQA Benchmark from Governmental White Papers
par: Sugiura, Issa, et autres
Publié: (2026)
par: Sugiura, Issa, et autres
Publié: (2026)
Polos: Multimodal Metric Learning from Human Feedback for Image Captioning
par: Wada, Yuiga, et autres
Publié: (2024)
par: Wada, Yuiga, et autres
Publié: (2024)
WAON: A Large-Scale Japanese Image-Text Dataset for Cultural Adaptation in Contrastive Vision-Language Models
par: Sugiura, Issa, et autres
Publié: (2025)
par: Sugiura, Issa, et autres
Publié: (2025)
Cortical-SSM: A Deep State Space Model for EEG and ECoG Motor Imagery Decoding
par: Suzuki, Shuntaro, et autres
Publié: (2025)
par: Suzuki, Shuntaro, et autres
Publié: (2025)
Layer-Wise Relevance Propagation with Conservation Property for ResNet
par: Otsuki, Seitaro, et autres
Publié: (2024)
par: Otsuki, Seitaro, et autres
Publié: (2024)
JAMMEval: A Refined Collection of Japanese Benchmarks for Reliable VLM Evaluation
par: Sugiura, Issa, et autres
Publié: (2026)
par: Sugiura, Issa, et autres
Publié: (2026)
Cross3DVG: Cross-Dataset 3D Visual Grounding on Different RGB-D Scans
par: Miyanishi, Taiki, et autres
Publié: (2023)
par: Miyanishi, Taiki, et autres
Publié: (2023)
Jagle: Building a Large-Scale Japanese Multimodal Post-Training Dataset for Vision-Language Models
par: Sugiura, Issa, et autres
Publié: (2026)
par: Sugiura, Issa, et autres
Publié: (2026)
DENEB: A Hallucination-Robust Automatic Evaluation Metric for Image Captioning
par: Matsuda, Kazuki, et autres
Publié: (2024)
par: Matsuda, Kazuki, et autres
Publié: (2024)
Evaluating Multimodal Large Language Models on Vertically Written Japanese Text
par: Sasagawa, Keito, et autres
Publié: (2025)
par: Sasagawa, Keito, et autres
Publié: (2025)
Affordance RAG: Hierarchical Multimodal Retrieval with Affordance-Aware Embodied Memory for Mobile Manipulation
par: Korekata, Ryosuke, et autres
Publié: (2025)
par: Korekata, Ryosuke, et autres
Publié: (2025)
FLARE-SSM: Deep State Space Models with Influence-Balanced Loss for 72-Hour Solar Flare Prediction
par: Takagi, Yusuke, et autres
Publié: (2025)
par: Takagi, Yusuke, et autres
Publié: (2025)
Vision Language Model-based Caption Evaluation Method Leveraging Visual Context Extraction
par: Maeda, Koki, et autres
Publié: (2024)
par: Maeda, Koki, et autres
Publié: (2024)
Future Success Prediction in Open-Vocabulary Object Manipulation Tasks Based on End-Effector Trajectories
par: Kambara, Motonari, et autres
Publié: (2024)
par: Kambara, Motonari, et autres
Publié: (2024)
Deep Space Weather Model: Long-Range Solar Flare Prediction from Multi-Wavelength Images
par: Nagashima, Shunya, et autres
Publié: (2025)
par: Nagashima, Shunya, et autres
Publié: (2025)
Llama-Mimi: Exploring the Limits of Flattened Speech Language Modeling
par: Sugiura, Issa, et autres
Publié: (2025)
par: Sugiura, Issa, et autres
Publié: (2025)
Object Segmentation from Open-Vocabulary Manipulation Instructions Based on Optimal Transport Polygon Matching with Multimodal Foundation Models
par: Nishimura, Takayuki, et autres
Publié: (2024)
par: Nishimura, Takayuki, et autres
Publié: (2024)
ZINA: Multimodal Fine-grained Hallucination Detection and Editing
par: Wada, Yuiga, et autres
Publié: (2025)
par: Wada, Yuiga, et autres
Publié: (2025)
Answerability Fields: Answerable Location Estimation via Diffusion Models
par: Azuma, Daichi, et autres
Publié: (2024)
par: Azuma, Daichi, et autres
Publié: (2024)
Map-based Modular Approach for Zero-shot Embodied Question Answering
par: Sakamoto, Koya, et autres
Publié: (2024)
par: Sakamoto, Koya, et autres
Publié: (2024)
AnoleVLA: Lightweight Vision-Language-Action Model with Deep State Space Models for Mobile Manipulation
par: Takagi, Yusuke, et autres
Publié: (2026)
par: Takagi, Yusuke, et autres
Publié: (2026)
EC-Bench: Enumeration and Counting Benchmark for Ultra-Long Videos
par: Tsuchiya, Fumihiko, et autres
Publié: (2026)
par: Tsuchiya, Fumihiko, et autres
Publié: (2026)
Attention Lattice Adapter: Visual Explanation Generation for Visual Foundation Model
par: Hirano, Shinnosuke, et autres
Publié: (2025)
par: Hirano, Shinnosuke, et autres
Publié: (2025)
Stitch4D: Sparse Multi-Location 4D Urban Reconstruction via Spatio-Temporal Interpolation
par: Kogure, Hina, et autres
Publié: (2026)
par: Kogure, Hina, et autres
Publié: (2026)
CityNav: A Large-Scale Dataset for Real-World Aerial Navigation
par: Lee, Jungdae, et autres
Publié: (2024)
par: Lee, Jungdae, et autres
Publié: (2024)
DM2RM: Dual-Mode Multimodal Ranking for Target Objects and Receptacles Based on Open-Vocabulary Instructions
par: Korekata, Ryosuke, et autres
Publié: (2024)
par: Korekata, Ryosuke, et autres
Publié: (2024)
LongCaptioning: Unlocking the Power of Long Video Caption Generation in Large Multimodal Models
par: Wei, Hongchen, et autres
Publié: (2025)
par: Wei, Hongchen, et autres
Publié: (2025)
STATUS Bench: A Rigorous Benchmark for Evaluating Object State Understanding in Vision-Language Models
par: Ukai, Mahiro, et autres
Publié: (2025)
par: Ukai, Mahiro, et autres
Publié: (2025)
GeoProg3D: Compositional Visual Reasoning for City-Scale 3D Language Fields
par: Yasuki, Shunsuke, et autres
Publié: (2025)
par: Yasuki, Shunsuke, et autres
Publié: (2025)
PhysQuantAgent: An Inference Pipeline of Mass Estimation for Vision-Language Models
par: Yokomizo, Hisayuki, et autres
Publié: (2026)
par: Yokomizo, Hisayuki, et autres
Publié: (2026)
E3VS-Bench: A Benchmark for Viewpoint-Dependent Active Perception in 3D Gaussian Splatting Scenes
par: Sakamoto, Koya, et autres
Publié: (2026)
par: Sakamoto, Koya, et autres
Publié: (2026)
HAVEN: Hierarchically Aligned Multimodal Benchmark for Unified Video Understanding
par: Shi, Mengqi, et autres
Publié: (2026)
par: Shi, Mengqi, et autres
Publié: (2026)
Documents similaires
-
ReMoRa: Multimodal Large Language Model based on Refined Motion Representation for Long-Video Understanding
par: Yashima, Daichi, et autres
Publié: (2026) -
NaiLIA: Multimodal Nail Design Retrieval Based on Dense Intent Descriptions and Palette Queries
par: Amemiya, Kanon, et autres
Publié: (2026) -
Task Success Prediction for Open-Vocabulary Manipulation Based on Multi-Level Aligned Representations
par: Goko, Miyu, et autres
Publié: (2024) -
LLM-Free Image Captioning Evaluation in Reference-Flexible Settings
par: Hirano, Shinnosuke, et autres
Publié: (2025) -
HiFlow: Tokenization-Free Scale-Wise Autoregressive Policy Learning via Flow Matching
par: Yashima, Daichi, et autres
Publié: (2026)