QuoTA: Query-oriented Token Assignment via CoT Query Decouple for Long Video Comprehension
Fuente:
arXiv
Guardado en:
| Autores principales: | Luo, Yongdong, Chen, Wang, Zheng, Xiawu, Huang, Weizhong, Yin, Shukang, Lin, Haojia, Fu, Chaoyou, Huang, Jinfa, Ji, Jiayi, Luo, Jiebo, Ji, Rongrong |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Video-RAG: Visually-aligned Retrieval-Augmented Long Video Comprehension
por: Luo, Yongdong, et al.
Publicado: (2024)
por: Luo, Yongdong, et al.
Publicado: (2024)
SpecEyes: Accelerating Agentic Multimodal LLMs via Speculative Perception and Planning
por: Huang, Haoyu, et al.
Publicado: (2026)
por: Huang, Haoyu, et al.
Publicado: (2026)
Towards Efficient Automatic Self-Pruning of Large Language Models
por: Huang, Weizhong, et al.
Publicado: (2025)
por: Huang, Weizhong, et al.
Publicado: (2025)
Determining Layer-wise Sparsity for Large Language Models Through a Theoretical Perspective
por: Huang, Weizhong, et al.
Publicado: (2025)
por: Huang, Weizhong, et al.
Publicado: (2025)
Continuous-Multiple Image Outpainting in One-Step via Positional Query and A Diffusion-based Approach
por: Zhang, Shaofeng, et al.
Publicado: (2024)
por: Zhang, Shaofeng, et al.
Publicado: (2024)
Rethinking 3D Dense Caption and Visual Grounding in A Unified Framework through Prompt-based Localization
por: Luo, Yongdong, et al.
Publicado: (2024)
por: Luo, Yongdong, et al.
Publicado: (2024)
Event-Anchored Frame Selection for Effective Long-Video Understanding
por: Chen, Wang, et al.
Publicado: (2026)
por: Chen, Wang, et al.
Publicado: (2026)
SocialOmni: Benchmarking Audio-Visual Social Interactivity in Omni Models
por: Xie, Tianyu, et al.
Publicado: (2026)
por: Xie, Tianyu, et al.
Publicado: (2026)
CIR-CoT: Towards Interpretable Composed Image Retrieval via End-to-End Chain-of-Thought Reasoning
por: Lin, Weihuang, et al.
Publicado: (2025)
por: Lin, Weihuang, et al.
Publicado: (2025)
Wavelet-based Frame Selection by Detecting Semantic Boundary for Long Video Understanding
por: Chen, Wang, et al.
Publicado: (2026)
por: Chen, Wang, et al.
Publicado: (2026)
VEGA: Learning Interleaved Image-Text Comprehension in Vision-Language Large Models
por: Zhou, Chenyu, et al.
Publicado: (2024)
por: Zhou, Chenyu, et al.
Publicado: (2024)
Dynamic Low-Rank Sparse Adaptation for Large Language Models
por: Huang, Weizhong, et al.
Publicado: (2025)
por: Huang, Weizhong, et al.
Publicado: (2025)
Evolver: Chain-of-Evolution Prompting to Boost Large Multimodal Models for Hateful Meme Detection
por: Huang, Jinfa, et al.
Publicado: (2024)
por: Huang, Jinfa, et al.
Publicado: (2024)
Through the Valley: Path to Effective Long CoT Training for Small Language Models
por: Luo, Renjie, et al.
Publicado: (2025)
por: Luo, Renjie, et al.
Publicado: (2025)
Query-oriented Data Augmentation for Session Search
por: Chen, Haonan, et al.
Publicado: (2024)
por: Chen, Haonan, et al.
Publicado: (2024)
Multi-branch Collaborative Learning Network for 3D Visual Grounding
por: Qian, Zhipeng, et al.
Publicado: (2024)
por: Qian, Zhipeng, et al.
Publicado: (2024)
Feast Your Eyes: Mixture-of-Resolution Adaptation for Multimodal Large Language Models
por: Luo, Gen, et al.
Publicado: (2024)
por: Luo, Gen, et al.
Publicado: (2024)
Benchmarking Abstract and Reasoning Abilities Through A Theoretical Perspective
por: Ma, Qingchuan, et al.
Publicado: (2025)
por: Ma, Qingchuan, et al.
Publicado: (2025)
Sparrow: Data-Efficient Video-LLM with Text-to-Image Augmentation
por: Yin, Shukang, et al.
Publicado: (2024)
por: Yin, Shukang, et al.
Publicado: (2024)
VideoDetective: Clue Hunting via both Extrinsic Query and Intrinsic Relevance for Long Video Understanding
por: Yang, Ruoliu, et al.
Publicado: (2026)
por: Yang, Ruoliu, et al.
Publicado: (2026)
TRAP: Hijacking VLA CoT-Reasoning via Adversarial Patches
por: Huang, Zhengxian, et al.
Publicado: (2026)
por: Huang, Zhengxian, et al.
Publicado: (2026)
Autoregressive Queries for Adaptive Tracking with Spatio-TemporalTransformers
por: Xie, Jinxia, et al.
Publicado: (2024)
por: Xie, Jinxia, et al.
Publicado: (2024)
Watch Where You Move: Region-aware Dynamic Aggregation and Excitation for Gait Recognition
por: Huang, Binyuan, et al.
Publicado: (2025)
por: Huang, Binyuan, et al.
Publicado: (2025)
$γ-$MoD: Exploring Mixture-of-Depth Adaptation for Multimodal Large Language Models
por: Luo, Yaxin, et al.
Publicado: (2024)
por: Luo, Yaxin, et al.
Publicado: (2024)
Quantum Query Complexity of the Hyperoctahedral Group
por: Bae, Ji Ho
Publicado: (2026)
por: Bae, Ji Ho
Publicado: (2026)
Training-Free Multimodal Large Language Model Orchestration
por: Xie, Tianyu, et al.
Publicado: (2025)
por: Xie, Tianyu, et al.
Publicado: (2025)
Long-VITA: Scaling Large Multi-modal Models to 1 Million Tokens with Leading Short-Context Accuracy
por: Shen, Yunhang, et al.
Publicado: (2025)
por: Shen, Yunhang, et al.
Publicado: (2025)
Seeing the Forest and the Trees: Query-Aware Tokenizer for Long-Video Multimodal Language Models
por: Li, Siyou, et al.
Publicado: (2025)
por: Li, Siyou, et al.
Publicado: (2025)
Stochastic Representation of Time-Evolving Neural Network-based Wavefunctions
por: Huang, Bizi, et al.
Publicado: (2025)
por: Huang, Bizi, et al.
Publicado: (2025)
MME: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models
por: Fu, Chaoyou, et al.
Publicado: (2023)
por: Fu, Chaoyou, et al.
Publicado: (2023)
QueryOcc: Query-based Self-Supervision for 3D Semantic Occupancy
por: Lilja, Adam, et al.
Publicado: (2025)
por: Lilja, Adam, et al.
Publicado: (2025)
Identity-Preserving Text-to-Video Generation by Frequency Decomposition
por: Yuan, Shenghai, et al.
Publicado: (2024)
por: Yuan, Shenghai, et al.
Publicado: (2024)
OpenS2V-Nexus: A Detailed Benchmark and Million-Scale Dataset for Subject-to-Video Generation
por: Yuan, Shenghai, et al.
Publicado: (2025)
por: Yuan, Shenghai, et al.
Publicado: (2025)
MiCoTA: Bridging the Learnability Gap with Intermediate CoT and Teacher Assistants
por: Ding, Dongyi, et al.
Publicado: (2025)
por: Ding, Dongyi, et al.
Publicado: (2025)
HRSAM: Efficient Interactive Segmentation in High-Resolution Images
por: Huang, You, et al.
Publicado: (2024)
por: Huang, You, et al.
Publicado: (2024)
Inter2Former: Dynamic Hybrid Attention for Efficient High-Precision Interactive
por: Huang, You, et al.
Publicado: (2025)
por: Huang, You, et al.
Publicado: (2025)
SIMD-Aware Homomorphic Compression and Application to Private Database Query
por: Cheon, Jung Hee, et al.
Publicado: (2024)
por: Cheon, Jung Hee, et al.
Publicado: (2024)
ComfyGPT: A Self-Optimizing Multi-Agent System for Comprehensive ComfyUI Workflow Generation
por: Huang, Oucheng, et al.
Publicado: (2025)
por: Huang, Oucheng, et al.
Publicado: (2025)
Training Long-Context LLMs Efficiently via Chunk-wise Optimization
por: Li, Wenhao, et al.
Publicado: (2025)
por: Li, Wenhao, et al.
Publicado: (2025)
SpeechParaling-Bench: A Comprehensive Benchmark for Paralinguistic-Aware Speech Generation
por: Liu, Ruohan, et al.
Publicado: (2026)
por: Liu, Ruohan, et al.
Publicado: (2026)
Ejemplares similares
-
Video-RAG: Visually-aligned Retrieval-Augmented Long Video Comprehension
por: Luo, Yongdong, et al.
Publicado: (2024) -
SpecEyes: Accelerating Agentic Multimodal LLMs via Speculative Perception and Planning
por: Huang, Haoyu, et al.
Publicado: (2026) -
Towards Efficient Automatic Self-Pruning of Large Language Models
por: Huang, Weizhong, et al.
Publicado: (2025) -
Determining Layer-wise Sparsity for Large Language Models Through a Theoretical Perspective
por: Huang, Weizhong, et al.
Publicado: (2025) -
Continuous-Multiple Image Outpainting in One-Step via Positional Query and A Diffusion-based Approach
por: Zhang, Shaofeng, et al.
Publicado: (2024)