SpecEyes: Accelerating Agentic Multimodal LLMs via Speculative Perception and Planning
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Huang, Haoyu, Huang, Jinfa, Wan, Zhongwei, Zheng, Xiawu, Ji, Rongrong, Luo, Jiebo |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2026
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Evolver: Chain-of-Evolution Prompting to Boost Large Multimodal Models for Hateful Meme Detection
von: Huang, Jinfa, et al.
Veröffentlicht: (2024)
von: Huang, Jinfa, et al.
Veröffentlicht: (2024)
QuoTA: Query-oriented Token Assignment via CoT Query Decouple for Long Video Comprehension
von: Luo, Yongdong, et al.
Veröffentlicht: (2025)
von: Luo, Yongdong, et al.
Veröffentlicht: (2025)
LOOK-M: Look-Once Optimization in KV Cache for Efficient Multimodal Long-Context Inference
von: Wan, Zhongwei, et al.
Veröffentlicht: (2024)
von: Wan, Zhongwei, et al.
Veröffentlicht: (2024)
SpecVLM: Enhancing Speculative Decoding of Video LLMs via Verifier-Guided Token Pruning
von: Ji, Yicheng, et al.
Veröffentlicht: (2025)
von: Ji, Yicheng, et al.
Veröffentlicht: (2025)
Feast Your Eyes: Mixture-of-Resolution Adaptation for Multimodal Large Language Models
von: Luo, Gen, et al.
Veröffentlicht: (2024)
von: Luo, Gen, et al.
Veröffentlicht: (2024)
ViSpec: Accelerating Vision-Language Models with Vision-Aware Speculative Decoding
von: Kang, Jialiang, et al.
Veröffentlicht: (2025)
von: Kang, Jialiang, et al.
Veröffentlicht: (2025)
Video-RAG: Visually-aligned Retrieval-Augmented Long Video Comprehension
von: Luo, Yongdong, et al.
Veröffentlicht: (2024)
von: Luo, Yongdong, et al.
Veröffentlicht: (2024)
TACO: Enhancing Multimodal In-context Learning via Task Mapping-Guided Sequence Configuration
von: Li, Yanshu, et al.
Veröffentlicht: (2025)
von: Li, Yanshu, et al.
Veröffentlicht: (2025)
Cantor: Inspiring Multimodal Chain-of-Thought of MLLM
von: Gao, Timin, et al.
Veröffentlicht: (2024)
von: Gao, Timin, et al.
Veröffentlicht: (2024)
LogitSpec: Accelerating Retrieval-based Speculative Decoding via Next Next Token Speculation
von: Liu, Tianyu, et al.
Veröffentlicht: (2025)
von: Liu, Tianyu, et al.
Veröffentlicht: (2025)
ChronoMagic-Bench: A Benchmark for Metamorphic Evaluation of Text-to-Time-lapse Video Generation
von: Yuan, Shenghai, et al.
Veröffentlicht: (2024)
von: Yuan, Shenghai, et al.
Veröffentlicht: (2024)
Benchmarking Abstract and Reasoning Abilities Through A Theoretical Perspective
von: Ma, Qingchuan, et al.
Veröffentlicht: (2025)
von: Ma, Qingchuan, et al.
Veröffentlicht: (2025)
Autoregressive Models in Vision: A Survey
von: Xiong, Jing, et al.
Veröffentlicht: (2024)
von: Xiong, Jing, et al.
Veröffentlicht: (2024)
Perception, Reason, Think, and Plan: A Survey on Large Multimodal Reasoning Models
von: Li, Yunxin, et al.
Veröffentlicht: (2025)
von: Li, Yunxin, et al.
Veröffentlicht: (2025)
VEGA: Learning Interleaved Image-Text Comprehension in Vision-Language Large Models
von: Zhou, Chenyu, et al.
Veröffentlicht: (2024)
von: Zhou, Chenyu, et al.
Veröffentlicht: (2024)
HASTE: Training-Free Video Diffusion Acceleration via Head-Wise Adaptive Sparse Attention
von: Zheng, Xuzhe, et al.
Veröffentlicht: (2026)
von: Zheng, Xuzhe, et al.
Veröffentlicht: (2026)
Accelerating Multimodal Large Language Models via Dynamic Visual-Token Exit and the Empirical Findings
von: Wu, Qiong, et al.
Veröffentlicht: (2024)
von: Wu, Qiong, et al.
Veröffentlicht: (2024)
NanoSpec: Accelerating Speculative Decoding using Minimalist In-Context Vocabularies
von: Chen, Zhiyang, et al.
Veröffentlicht: (2026)
von: Chen, Zhiyang, et al.
Veröffentlicht: (2026)
SpecHop: Continuous Speculation for Accelerating Multi-Hop Retrieval Agents
von: Saberi, Mehrdad, et al.
Veröffentlicht: (2026)
von: Saberi, Mehrdad, et al.
Veröffentlicht: (2026)
ToolSpec: Accelerating Tool Calling via Schema-Aware and Retrieval-Augmented Speculative Decoding
von: Xia, Heming, et al.
Veröffentlicht: (2026)
von: Xia, Heming, et al.
Veröffentlicht: (2026)
Irony in Emojis: A Comparative Study of Human and LLM Interpretation
von: Zheng, Yawen, et al.
Veröffentlicht: (2025)
von: Zheng, Yawen, et al.
Veröffentlicht: (2025)
HiSpec: Hierarchical Speculative Decoding for LLMs
von: Kumar, Avinash, et al.
Veröffentlicht: (2025)
von: Kumar, Avinash, et al.
Veröffentlicht: (2025)
SpecHub: Provable Acceleration to Multi-Draft Speculative Decoding
von: Sun, Ryan, et al.
Veröffentlicht: (2024)
von: Sun, Ryan, et al.
Veröffentlicht: (2024)
Training-Free Multimodal Large Language Model Orchestration
von: Xie, Tianyu, et al.
Veröffentlicht: (2025)
von: Xie, Tianyu, et al.
Veröffentlicht: (2025)
UI-AGILE: Advancing GUI Agents with Effective Reinforcement Learning and Precise Inference-Time Grounding
von: Lian, Shuquan, et al.
Veröffentlicht: (2025)
von: Lian, Shuquan, et al.
Veröffentlicht: (2025)
SpecTr-GBV: Multi-Draft Block Verification Accelerating Speculative Decoding
von: Lin, Yijun, et al.
Veröffentlicht: (2026)
von: Lin, Yijun, et al.
Veröffentlicht: (2026)
SpecExit: Accelerating Large Reasoning Model via Speculative Exit
von: Yang, Rubing, et al.
Veröffentlicht: (2025)
von: Yang, Rubing, et al.
Veröffentlicht: (2025)
The Percept-V Challenge: Can Multimodal LLMs Crack Simple Perception Problems?
von: Ghosh, Samrajnee, et al.
Veröffentlicht: (2025)
von: Ghosh, Samrajnee, et al.
Veröffentlicht: (2025)
SpecDec++: Boosting Speculative Decoding via Adaptive Candidate Lengths
von: Huang, Kaixuan, et al.
Veröffentlicht: (2024)
von: Huang, Kaixuan, et al.
Veröffentlicht: (2024)
Speculate Deep and Accurate: Lossless and Training-Free Acceleration for Offloaded LLMs via Substitute Speculative Decoding
von: Wang, Pei-Shuo, et al.
Veröffentlicht: (2025)
von: Wang, Pei-Shuo, et al.
Veröffentlicht: (2025)
VITA: Towards Open-Source Interactive Omni Multimodal LLM
von: Fu, Chaoyou, et al.
Veröffentlicht: (2024)
von: Fu, Chaoyou, et al.
Veröffentlicht: (2024)
FR-Spec: Accelerating Large-Vocabulary Language Models via Frequency-Ranked Speculative Sampling
von: Zhao, Weilin, et al.
Veröffentlicht: (2025)
von: Zhao, Weilin, et al.
Veröffentlicht: (2025)
IV-Bench: A Benchmark for Image-Grounded Video Perception and Reasoning in Multimodal LLMs
von: Ma, David, et al.
Veröffentlicht: (2025)
von: Ma, David, et al.
Veröffentlicht: (2025)
Continuous-Multiple Image Outpainting in One-Step via Positional Query and A Diffusion-based Approach
von: Zhang, Shaofeng, et al.
Veröffentlicht: (2024)
von: Zhang, Shaofeng, et al.
Veröffentlicht: (2024)
Spec-LLaVA: Accelerating Vision-Language Models with Dynamic Tree-Based Speculative Decoding
von: Huo, Mingxiao, et al.
Veröffentlicht: (2025)
von: Huo, Mingxiao, et al.
Veröffentlicht: (2025)
DEEM: Diffusion Models Serve as the Eyes of Large Language Models for Image Perception
von: Luo, Run, et al.
Veröffentlicht: (2024)
von: Luo, Run, et al.
Veröffentlicht: (2024)
SpecBlock: Block-Iterative Speculative Decoding with Dynamic Tree Drafting
von: Shi, Weijie, et al.
Veröffentlicht: (2026)
von: Shi, Weijie, et al.
Veröffentlicht: (2026)
SlimSpec: Low-Rank Draft LM-Head for Accelerated Speculative Decoding
von: Plaksin, Anton, et al.
Veröffentlicht: (2026)
von: Plaksin, Anton, et al.
Veröffentlicht: (2026)
MoDES: Accelerating Mixture-of-Experts Multimodal Large Language Models via Dynamic Expert Skipping
von: Huang, Yushi, et al.
Veröffentlicht: (2025)
von: Huang, Yushi, et al.
Veröffentlicht: (2025)
Speculative Decoding Reimagined for Multimodal Large Language Models
von: Lin, Luxi, et al.
Veröffentlicht: (2025)
von: Lin, Luxi, et al.
Veröffentlicht: (2025)
Ähnliche Einträge
-
Evolver: Chain-of-Evolution Prompting to Boost Large Multimodal Models for Hateful Meme Detection
von: Huang, Jinfa, et al.
Veröffentlicht: (2024) -
QuoTA: Query-oriented Token Assignment via CoT Query Decouple for Long Video Comprehension
von: Luo, Yongdong, et al.
Veröffentlicht: (2025) -
LOOK-M: Look-Once Optimization in KV Cache for Efficient Multimodal Long-Context Inference
von: Wan, Zhongwei, et al.
Veröffentlicht: (2024) -
SpecVLM: Enhancing Speculative Decoding of Video LLMs via Verifier-Guided Token Pruning
von: Ji, Yicheng, et al.
Veröffentlicht: (2025) -
Feast Your Eyes: Mixture-of-Resolution Adaptation for Multimodal Large Language Models
von: Luo, Gen, et al.
Veröffentlicht: (2024)