DualFocus: Integrating Macro and Micro Perspectives in Multi-modal Large Language Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Cao, Yuhang, Zhang, Pan, Dong, Xiaoyi, Lin, Dahua, Wang, Jiaqi |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Deciphering Cross-Modal Alignment in Large Vision-Language Models with Modality Integration Rate
di: Huang, Qidong, et al.
Pubblicazione: (2024)
di: Huang, Qidong, et al.
Pubblicazione: (2024)
Streaming Long Video Understanding with Large Language Models
di: Qian, Rui, et al.
Pubblicazione: (2024)
di: Qian, Rui, et al.
Pubblicazione: (2024)
DualFocus: Depth from Focus with Spatio-Focal Dual Variational Constraints
di: Woo, Sungmin, et al.
Pubblicazione: (2025)
di: Woo, Sungmin, et al.
Pubblicazione: (2025)
MIA-DPO: Multi-Image Augmented Direct Preference Optimization For Large Vision-Language Models
di: Liu, Ziyu, et al.
Pubblicazione: (2024)
di: Liu, Ziyu, et al.
Pubblicazione: (2024)
Visual Self-Refine: A Pixel-Guided Paradigm for Accurate Chart Parsing
di: Li, Jinsong, et al.
Pubblicazione: (2026)
di: Li, Jinsong, et al.
Pubblicazione: (2026)
Dispider: Enabling Video LLMs with Active Real-Time Interaction via Disentangled Perception, Decision, and Reaction
di: Qian, Rui, et al.
Pubblicazione: (2025)
di: Qian, Rui, et al.
Pubblicazione: (2025)
ByTheWay: Boost Your Text-to-Video Generation Model to Higher Quality in a Training-free Way
di: Bu, Jiazi, et al.
Pubblicazione: (2024)
di: Bu, Jiazi, et al.
Pubblicazione: (2024)
OPERA: Alleviating Hallucination in Multi-Modal Large Language Models via Over-Trust Penalty and Retrospection-Allocation
di: Huang, Qidong, et al.
Pubblicazione: (2023)
di: Huang, Qidong, et al.
Pubblicazione: (2023)
Are We on the Right Way for Evaluating Large Vision-Language Models?
di: Chen, Lin, et al.
Pubblicazione: (2024)
di: Chen, Lin, et al.
Pubblicazione: (2024)
Think Visually, Reason Textually: Vision-Language Synergy in ARC
di: Zhang, Beichen, et al.
Pubblicazione: (2025)
di: Zhang, Beichen, et al.
Pubblicazione: (2025)
PyramidDrop: Accelerating Your Large Vision-Language Models via Pyramid Visual Redundancy Reduction
di: Xing, Long, et al.
Pubblicazione: (2024)
di: Xing, Long, et al.
Pubblicazione: (2024)
Unified Scene Representation and Reconstruction for 3D Large Language Models
di: Chu, Tao, et al.
Pubblicazione: (2024)
di: Chu, Tao, et al.
Pubblicazione: (2024)
SAM2Long: Enhancing SAM 2 for Long Video Segmentation with a Training-Free Memory Tree
di: Ding, Shuangrui, et al.
Pubblicazione: (2024)
di: Ding, Shuangrui, et al.
Pubblicazione: (2024)
Visual-RFT: Visual Reinforcement Fine-Tuning
di: Liu, Ziyu, et al.
Pubblicazione: (2025)
di: Liu, Ziyu, et al.
Pubblicazione: (2025)
HiFlow: Training-free High-Resolution Image Generation with Flow-Aligned Guidance
di: Bu, Jiazi, et al.
Pubblicazione: (2025)
di: Bu, Jiazi, et al.
Pubblicazione: (2025)
MM-IFEngine: Towards Multimodal Instruction Following
di: Ding, Shengyuan, et al.
Pubblicazione: (2025)
di: Ding, Shengyuan, et al.
Pubblicazione: (2025)
ReasonPix2Pix: Instruction Reasoning Dataset for Advanced Image Editing
di: Jin, Ying, et al.
Pubblicazione: (2024)
di: Jin, Ying, et al.
Pubblicazione: (2024)
Bootstrap3D: Improving Multi-view Diffusion Model with Synthetic Data
di: Sun, Zeyi, et al.
Pubblicazione: (2024)
di: Sun, Zeyi, et al.
Pubblicazione: (2024)
SPARK: Synergistic Policy And Reward Co-Evolving Framework
di: Liu, Ziyu, et al.
Pubblicazione: (2025)
di: Liu, Ziyu, et al.
Pubblicazione: (2025)
ScaleCap: Inference-Time Scalable Image Captioning via Dual-Modality Debiasing
di: Xing, Long, et al.
Pubblicazione: (2025)
di: Xing, Long, et al.
Pubblicazione: (2025)
InternLM-XComposer2.5-Reward: A Simple Yet Effective Multi-Modal Reward Model
di: Zang, Yuhang, et al.
Pubblicazione: (2025)
di: Zang, Yuhang, et al.
Pubblicazione: (2025)
Spatial-SSRL: Enhancing Spatial Understanding via Self-Supervised Reinforcement Learning
di: Liu, Yuhong, et al.
Pubblicazione: (2025)
di: Liu, Yuhong, et al.
Pubblicazione: (2025)
Long-CLIP: Unlocking the Long-Text Capability of CLIP
di: Zhang, Beichen, et al.
Pubblicazione: (2024)
di: Zhang, Beichen, et al.
Pubblicazione: (2024)
2nd Place Report of MOSEv2 Challenge 2025: Concept Guided Video Object Segmentation via SeC
di: Zhang, Zhixiong, et al.
Pubblicazione: (2025)
di: Zhang, Zhixiong, et al.
Pubblicazione: (2025)
X-Prompt: Towards Universal In-Context Image Generation in Auto-Regressive Vision Language Foundation Models
di: Sun, Zeyi, et al.
Pubblicazione: (2024)
di: Sun, Zeyi, et al.
Pubblicazione: (2024)
VideoRoPE: What Makes for Good Video Rotary Position Embedding?
di: Wei, Xilin, et al.
Pubblicazione: (2025)
di: Wei, Xilin, et al.
Pubblicazione: (2025)
Visual Agentic Reinforcement Fine-Tuning
di: Liu, Ziyu, et al.
Pubblicazione: (2025)
di: Liu, Ziyu, et al.
Pubblicazione: (2025)
Advancing Complex Video Object Segmentation via Progressive Concept Construction
di: Zhang, Zhixiong, et al.
Pubblicazione: (2025)
di: Zhang, Zhixiong, et al.
Pubblicazione: (2025)
CODA: Coordinating the Cerebrum and Cerebellum for a Dual-Brain Computer Use Agent with Decoupled Reinforcement Learning
di: Sun, Zeyi, et al.
Pubblicazione: (2025)
di: Sun, Zeyi, et al.
Pubblicazione: (2025)
SepRep-Net: Multi-source Free Domain Adaptation via Model Separation And Reparameterization
di: Jin, Ying, et al.
Pubblicazione: (2024)
di: Jin, Ying, et al.
Pubblicazione: (2024)
ARM-Thinker: Reinforcing Multimodal Generative Reward Models with Agentic Tool Use and Visual Reasoning
di: Ding, Shengyuan, et al.
Pubblicazione: (2025)
di: Ding, Shengyuan, et al.
Pubblicazione: (2025)
CapRL: Stimulating Dense Image Caption Capabilities via Reinforcement Learning
di: Xing, Long, et al.
Pubblicazione: (2025)
di: Xing, Long, et al.
Pubblicazione: (2025)
Understanding the Multi-modal Prompts of the Pre-trained Vision-Language Model
di: Ma, Shuailei, et al.
Pubblicazione: (2023)
di: Ma, Shuailei, et al.
Pubblicazione: (2023)
MMDU: A Multi-Turn Multi-Image Dialog Understanding Benchmark and Instruction-Tuning Dataset for LVLMs
di: Liu, Ziyu, et al.
Pubblicazione: (2024)
di: Liu, Ziyu, et al.
Pubblicazione: (2024)
RAR: Retrieving And Ranking Augmented MLLMs for Visual Recognition
di: Liu, Ziyu, et al.
Pubblicazione: (2024)
di: Liu, Ziyu, et al.
Pubblicazione: (2024)
InternLM-XComposer2: Mastering Free-form Text-Image Composition and Comprehension in Vision-Language Large Model
di: Dong, Xiaoyi, et al.
Pubblicazione: (2024)
di: Dong, Xiaoyi, et al.
Pubblicazione: (2024)
SEAgent: Self-Evolving Computer Use Agent with Autonomous Learning from Experience
di: Sun, Zeyi, et al.
Pubblicazione: (2025)
di: Sun, Zeyi, et al.
Pubblicazione: (2025)
MMBench: Is Your Multi-modal Model an All-around Player?
di: Liu, Yuan, et al.
Pubblicazione: (2023)
di: Liu, Yuan, et al.
Pubblicazione: (2023)
DiCache: Let Diffusion Model Determine Its Own Cache
di: Bu, Jiazi, et al.
Pubblicazione: (2025)
di: Bu, Jiazi, et al.
Pubblicazione: (2025)
From Sparse to Dense: Multi-View GRPO for Flow Models via Augmented Condition Space
di: Bu, Jiazi, et al.
Pubblicazione: (2026)
di: Bu, Jiazi, et al.
Pubblicazione: (2026)
Documenti analoghi
-
Deciphering Cross-Modal Alignment in Large Vision-Language Models with Modality Integration Rate
di: Huang, Qidong, et al.
Pubblicazione: (2024) -
Streaming Long Video Understanding with Large Language Models
di: Qian, Rui, et al.
Pubblicazione: (2024) -
DualFocus: Depth from Focus with Spatio-Focal Dual Variational Constraints
di: Woo, Sungmin, et al.
Pubblicazione: (2025) -
MIA-DPO: Multi-Image Augmented Direct Preference Optimization For Large Vision-Language Models
di: Liu, Ziyu, et al.
Pubblicazione: (2024) -
Visual Self-Refine: A Pixel-Guided Paradigm for Accurate Chart Parsing
di: Li, Jinsong, et al.
Pubblicazione: (2026)