Needle In A Multimodal Haystack
Fuente:
arXiv
Salvato in:
| Autori principali: | Wang, Weiyun, Zhang, Shuibo, Ren, Yiming, Duan, Yuchen, Li, Tiantong, Liu, Shuo, Hu, Mengkang, Chen, Zhe, Zhang, Kaipeng, Lu, Lewei, Zhu, Xizhou, Luo, Ping, Qiao, Yu, Dai, Jifeng, Shao, Wenqi, Wang, Wenhai |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
The All-Seeing Project V2: Towards General Relation Comprehension of the Open World
di: Wang, Weiyun, et al.
Pubblicazione: (2024)
di: Wang, Weiyun, et al.
Pubblicazione: (2024)
Vision-RWKV: Efficient and Scalable Visual Perception with RWKV-Like Architectures
di: Duan, Yuchen, et al.
Pubblicazione: (2024)
di: Duan, Yuchen, et al.
Pubblicazione: (2024)
Enhancing the Reasoning Ability of Multimodal Large Language Models via Mixed Preference Optimization
di: Wang, Weiyun, et al.
Pubblicazione: (2024)
di: Wang, Weiyun, et al.
Pubblicazione: (2024)
Mini-InternVL: A Flexible-Transfer Pocket Multimodal Model with 5% Parameters and 90% Performance
di: Gao, Zhangwei, et al.
Pubblicazione: (2024)
di: Gao, Zhangwei, et al.
Pubblicazione: (2024)
OWMM-Agent: Open World Mobile Manipulation With Multi-modal Agentic Data Synthesis
di: Chen, Junting, et al.
Pubblicazione: (2025)
di: Chen, Junting, et al.
Pubblicazione: (2025)
Docopilot: Improving Multimodal Models for Document-Level Understanding
di: Duan, Yuchen, et al.
Pubblicazione: (2025)
di: Duan, Yuchen, et al.
Pubblicazione: (2025)
VisualPRM: An Effective Process Reward Model for Multimodal Reasoning
di: Wang, Weiyun, et al.
Pubblicazione: (2025)
di: Wang, Weiyun, et al.
Pubblicazione: (2025)
MMInstruct: A High-Quality Multi-Modal Instruction Tuning Dataset with Extensive Diversity
di: Liu, Yangzhou, et al.
Pubblicazione: (2024)
di: Liu, Yangzhou, et al.
Pubblicazione: (2024)
MMIU: Multimodal Multi-image Understanding for Evaluating Large Vision-Language Models
di: Meng, Fanqing, et al.
Pubblicazione: (2024)
di: Meng, Fanqing, et al.
Pubblicazione: (2024)
MM-Interleaved: Interleaved Image-Text Generative Modeling via Multi-modal Feature Synchronizer
di: Tian, Changyao, et al.
Pubblicazione: (2024)
di: Tian, Changyao, et al.
Pubblicazione: (2024)
Demystify Transformers & Convolutions in Modern Image Deep Networks
di: Hu, Xiaowei, et al.
Pubblicazione: (2022)
di: Hu, Xiaowei, et al.
Pubblicazione: (2022)
VisionLLM v2: An End-to-End Generalist Multimodal Large Language Model for Hundreds of Vision-Language Tasks
di: Wu, Jiannan, et al.
Pubblicazione: (2024)
di: Wu, Jiannan, et al.
Pubblicazione: (2024)
VisuLogic: A Benchmark for Evaluating Visual Reasoning in Multi-modal Large Language Models
di: Xu, Weiye, et al.
Pubblicazione: (2025)
di: Xu, Weiye, et al.
Pubblicazione: (2025)
HoVLE: Unleashing the Power of Monolithic Vision-Language Models with Holistic Vision-Language Embedding
di: Tao, Chenxin, et al.
Pubblicazione: (2024)
di: Tao, Chenxin, et al.
Pubblicazione: (2024)
Mono-InternVL-1.5: Towards Cheaper and Faster Monolithic Multimodal Large Language Models
di: Luo, Gen, et al.
Pubblicazione: (2025)
di: Luo, Gen, et al.
Pubblicazione: (2025)
CoMemo: LVLMs Need Image Context with Image Memory
di: Liu, Shi, et al.
Pubblicazione: (2025)
di: Liu, Shi, et al.
Pubblicazione: (2025)
PVC: Progressive Visual Token Compression for Unified Image and Video Processing in Large Vision-Language Models
di: Yang, Chenyu, et al.
Pubblicazione: (2024)
di: Yang, Chenyu, et al.
Pubblicazione: (2024)
Reasoning on Multiple Needles In A Haystack
di: Wang, Yidong
Pubblicazione: (2025)
di: Wang, Yidong
Pubblicazione: (2025)
Multimodal Needle in a Haystack: Benchmarking Long-Context Capability of Multimodal Large Language Models
di: Wang, Hengyi, et al.
Pubblicazione: (2024)
di: Wang, Hengyi, et al.
Pubblicazione: (2024)
Visual Embodied Brain: Let Multimodal Large Language Models See, Think, and Control in Spaces
di: Luo, Gen, et al.
Pubblicazione: (2025)
di: Luo, Gen, et al.
Pubblicazione: (2025)
InternVL: Scaling up Vision Foundation Models and Aligning for Generic Visual-Linguistic Tasks
di: Chen, Zhe, et al.
Pubblicazione: (2023)
di: Chen, Zhe, et al.
Pubblicazione: (2023)
Sequential-NIAH: A Needle-In-A-Haystack Benchmark for Extracting Sequential Needles from Long Contexts
di: Yu, Yifei, et al.
Pubblicazione: (2025)
di: Yu, Yifei, et al.
Pubblicazione: (2025)
DriveMLM: Aligning Multi-Modal Large Language Models with Behavioral Planning States for Autonomous Driving
di: Cui, Erfei, et al.
Pubblicazione: (2023)
di: Cui, Erfei, et al.
Pubblicazione: (2023)
Vision Model Pre-training on Interleaved Image-Text Data via Latent Compression Learning
di: Yang, Chenyu, et al.
Pubblicazione: (2024)
di: Yang, Chenyu, et al.
Pubblicazione: (2024)
Dynamic Multimodal Evaluation with Flexible Complexity by Vision-Language Bootstrapping
di: Yang, Yue, et al.
Pubblicazione: (2024)
di: Yang, Yue, et al.
Pubblicazione: (2024)
Parameter-Inverted Image Pyramid Networks for Visual Perception and Multimodal Understanding
di: Wang, Zhaokai, et al.
Pubblicazione: (2025)
di: Wang, Zhaokai, et al.
Pubblicazione: (2025)
NaViL: Rethinking Scaling Properties of Native Multimodal Large Language Models under Data Constraints
di: Tian, Changyao, et al.
Pubblicazione: (2025)
di: Tian, Changyao, et al.
Pubblicazione: (2025)
TP-Eval: Tap Multimodal LLMs' Potential in Evaluation by Customizing Prompts
di: Xie, Yuxuan, et al.
Pubblicazione: (2024)
di: Xie, Yuxuan, et al.
Pubblicazione: (2024)
ChartAssisstant: A Universal Chart Multimodal Language Model via Chart-to-Table Pre-training and Multitask Instruction Tuning
di: Meng, Fanqing, et al.
Pubblicazione: (2024)
di: Meng, Fanqing, et al.
Pubblicazione: (2024)
Visual Haystacks: A Vision-Centric Needle-In-A-Haystack Benchmark
di: Wu, Tsung-Han, et al.
Pubblicazione: (2024)
di: Wu, Tsung-Han, et al.
Pubblicazione: (2024)
Parameter-Inverted Image Pyramid Networks
di: Zhu, Xizhou, et al.
Pubblicazione: (2024)
di: Zhu, Xizhou, et al.
Pubblicazione: (2024)
Looking for the Information Needle in the Internet Haystack.
di: Clausen, Helge
Pubblicazione: (1996)
di: Clausen, Helge
Pubblicazione: (1996)
Efficient Deformable ConvNets: Rethinking Dynamic and Sparse Operator for Vision Applications
di: Xiong, Yuwen, et al.
Pubblicazione: (2024)
di: Xiong, Yuwen, et al.
Pubblicazione: (2024)
AnyCap Project: A Unified Framework, Dataset, and Benchmark for Controllable Omni-modal Captioning
di: Ren, Yiming, et al.
Pubblicazione: (2025)
di: Ren, Yiming, et al.
Pubblicazione: (2025)
RoboCodeX: Multimodal Code Generation for Robotic Behavior Synthesis
di: Mu, Yao, et al.
Pubblicazione: (2024)
di: Mu, Yao, et al.
Pubblicazione: (2024)
Auto MC-Reward: Automated Dense Reward Design with Large Language Models for Minecraft
di: Li, Hao, et al.
Pubblicazione: (2023)
di: Li, Hao, et al.
Pubblicazione: (2023)
DENIAHL: In-Context Features Influence LLM Needle-In-A-Haystack Abilities
di: Dai, Hui, et al.
Pubblicazione: (2024)
di: Dai, Hui, et al.
Pubblicazione: (2024)
Bounding Box Stability against Feature Dropout Reflects Detector Generalization across Environments
di: Yang, Yang, et al.
Pubblicazione: (2024)
di: Yang, Yang, et al.
Pubblicazione: (2024)
Finding BSM Needles in Electromagnetic Haystacks at DUNE
di: Brdar, Vedran, et al.
Pubblicazione: (2025)
di: Brdar, Vedran, et al.
Pubblicazione: (2025)
Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling
di: Chen, Zhe, et al.
Pubblicazione: (2024)
di: Chen, Zhe, et al.
Pubblicazione: (2024)
Documenti analoghi
-
The All-Seeing Project V2: Towards General Relation Comprehension of the Open World
di: Wang, Weiyun, et al.
Pubblicazione: (2024) -
Vision-RWKV: Efficient and Scalable Visual Perception with RWKV-Like Architectures
di: Duan, Yuchen, et al.
Pubblicazione: (2024) -
Enhancing the Reasoning Ability of Multimodal Large Language Models via Mixed Preference Optimization
di: Wang, Weiyun, et al.
Pubblicazione: (2024) -
Mini-InternVL: A Flexible-Transfer Pocket Multimodal Model with 5% Parameters and 90% Performance
di: Gao, Zhangwei, et al.
Pubblicazione: (2024) -
OWMM-Agent: Open World Mobile Manipulation With Multi-modal Agentic Data Synthesis
di: Chen, Junting, et al.
Pubblicazione: (2025)