Boosting Reasoning in Large Multimodal Models via Activation Replay
Fuente:
arXiv
Guardado en:
| Autores principales: | Xing, Yun, Hu, Xiaobin, He, Qingdong, Zhang, Jiangning, Yan, Shuicheng, Lu, Shijian, Jiang, Yu-Gang |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
PointSeg: A Training-Free Paradigm for 3D Scene Segmentation via Foundation Models
por: He, Qingdong, et al.
Publicado: (2024)
por: He, Qingdong, et al.
Publicado: (2024)
TokenAR: Multiple Subject Generation via Autoregressive Token-level enhancement
por: Sun, Haiyue, et al.
Publicado: (2025)
por: Sun, Haiyue, et al.
Publicado: (2025)
Referring Multiple Regions with Large Multimodal Models via Contextual Latent Steering
por: Xing, Yun, et al.
Publicado: (2026)
por: Xing, Yun, et al.
Publicado: (2026)
Human-MME: A Holistic Evaluation Benchmark for Human-Centric Multimodal Large Language Models
por: Liu, Yuansen, et al.
Publicado: (2025)
por: Liu, Yuansen, et al.
Publicado: (2025)
IVEBench: Modern Benchmark Suite for Instruction-Guided Video Editing Assessment
por: Chen, Yinan, et al.
Publicado: (2025)
por: Chen, Yinan, et al.
Publicado: (2025)
Multi-Dimensional Knowledge Profiling with Large-Scale Literature Database and Hierarchical Retrieval
por: Xue, Zhucun, et al.
Publicado: (2026)
por: Xue, Zhucun, et al.
Publicado: (2026)
Towards Generalized Multi-Image Editing for Unified Multimodal Models
por: Xu, Pengcheng, et al.
Publicado: (2026)
por: Xu, Pengcheng, et al.
Publicado: (2026)
Reasoning to Edit: Hypothetical Instruction-Based Image Editing with Visual Reasoning
por: He, Qingdong, et al.
Publicado: (2025)
por: He, Qingdong, et al.
Publicado: (2025)
Visual Document Understanding and Reasoning: A Multi-Agent Collaboration Framework with Agent-Wise Adaptive Test-Time Scaling
por: Yu, Xinlei, et al.
Publicado: (2025)
por: Yu, Xinlei, et al.
Publicado: (2025)
Visual Multi-Agent System: Mitigating Hallucination Snowballing via Visual Flow
por: Yu, Xinlei, et al.
Publicado: (2025)
por: Yu, Xinlei, et al.
Publicado: (2025)
NoiseBoost: Alleviating Hallucination with Noise Perturbation for Multimodal Large Language Models
por: Wu, Kai, et al.
Publicado: (2024)
por: Wu, Kai, et al.
Publicado: (2024)
Multimodal 3D Reasoning Segmentation with Complex Scenes
por: Jiang, Xueying, et al.
Publicado: (2024)
por: Jiang, Xueying, et al.
Publicado: (2024)
Reason3D: Searching and Reasoning 3D Segmentation via Large Language Model
por: Huang, Kuan-Chih, et al.
Publicado: (2024)
por: Huang, Kuan-Chih, et al.
Publicado: (2024)
IRPO: Boosting Image Restoration via Post-training GRPO
por: Xu, Haoxuan, et al.
Publicado: (2025)
por: Xu, Haoxuan, et al.
Publicado: (2025)
The devil is in the details: Enhancing Video Virtual Try-On via Keyframe-Driven Details Injection
por: He, Qingdong, et al.
Publicado: (2025)
por: He, Qingdong, et al.
Publicado: (2025)
RWKV-UNet: Improving UNet with Long-Range Cooperation for Effective Medical Image Segmentation
por: Jiang, Juntao, et al.
Publicado: (2025)
por: Jiang, Juntao, et al.
Publicado: (2025)
FitDiT: Advancing the Authentic Garment Details for High-fidelity Virtual Try-on
por: Jiang, Boyuan, et al.
Publicado: (2024)
por: Jiang, Boyuan, et al.
Publicado: (2024)
Open-Vocabulary SAM3D: Towards Training-free Open-Vocabulary 3D Scene Understanding
por: Tai, Hanchen, et al.
Publicado: (2024)
por: Tai, Hanchen, et al.
Publicado: (2024)
VisMem: Latent Vision Memory Unlocks Potential of Vision-Language Models
por: Yu, Xinlei, et al.
Publicado: (2025)
por: Yu, Xinlei, et al.
Publicado: (2025)
Point Cloud Mamba: Point Cloud Learning via State Space Model
por: Zhang, Tao, et al.
Publicado: (2024)
por: Zhang, Tao, et al.
Publicado: (2024)
Explore In-Context Segmentation via Latent Diffusion Models
por: Wang, Chaoyang, et al.
Publicado: (2024)
por: Wang, Chaoyang, et al.
Publicado: (2024)
CLEAR: Context-Aware Learning with End-to-End Mask-Free Inference for Adaptive Video Subtitle Removal
por: He, Qingdong, et al.
Publicado: (2026)
por: He, Qingdong, et al.
Publicado: (2026)
Spatial-Temporal Decoupled Reference Conditioning for Identity-Preserving Text-to-Video Generation
por: Chen, Yuheng, et al.
Publicado: (2026)
por: Chen, Yuheng, et al.
Publicado: (2026)
FeRA: Frequency-Energy Constrained Routing for Effective Diffusion Adaptation Fine-Tuning
por: Yin, Bo, et al.
Publicado: (2025)
por: Yin, Bo, et al.
Publicado: (2025)
DynamicControl: Adaptive Condition Selection for Improved Text-to-Image Generation
por: He, Qingdong, et al.
Publicado: (2024)
por: He, Qingdong, et al.
Publicado: (2024)
Combating Multimodal LLM Hallucination via Bottom-Up Holistic Reasoning
por: Wu, Shengqiong, et al.
Publicado: (2024)
por: Wu, Shengqiong, et al.
Publicado: (2024)
Dual Latent Memory for Visual Multi-agent System
por: Yu, Xinlei, et al.
Publicado: (2026)
por: Yu, Xinlei, et al.
Publicado: (2026)
PointRWKV: Efficient RWKV-Like Model for Hierarchical Point Cloud Learning
por: He, Qingdong, et al.
Publicado: (2024)
por: He, Qingdong, et al.
Publicado: (2024)
Unveil Inversion and Invariance in Flow Transformer for Versatile Image Editing
por: Xu, Pengcheng, et al.
Publicado: (2024)
por: Xu, Pengcheng, et al.
Publicado: (2024)
Mitigating Object Hallucination via Concentric Causal Attention
por: Xing, Yun, et al.
Publicado: (2024)
por: Xing, Yun, et al.
Publicado: (2024)
The Curse of Multi-Modalities: Evaluating Hallucinations of Large Multimodal Models across Language, Visual, and Audio
por: Leng, Sicong, et al.
Publicado: (2024)
por: Leng, Sicong, et al.
Publicado: (2024)
Collaborative Face Experts Fusion in Video Generation: Boosting Identity Consistency Across Large Face Poses
por: Wang, Yuji, et al.
Publicado: (2025)
por: Wang, Yuji, et al.
Publicado: (2025)
Boosting SAM for Cross-Domain Few-Shot Segmentation via Conditional Point Sparsification
por: Nie, Jiahao, et al.
Publicado: (2026)
por: Nie, Jiahao, et al.
Publicado: (2026)
Bridge Feature Matching and Cross-Modal Alignment with Mutual-filtering for Zero-shot Anomaly Detection
por: Bai, Yuhu, et al.
Publicado: (2025)
por: Bai, Yuhu, et al.
Publicado: (2025)
Direction-aware 3D Large Multimodal Models
por: Liu, Quan, et al.
Publicado: (2026)
por: Liu, Quan, et al.
Publicado: (2026)
Enhancing Spatial Reasoning in Multimodal Large Language Models through Reasoning-based Segmentation
por: Ning, Zhenhua, et al.
Publicado: (2025)
por: Ning, Zhenhua, et al.
Publicado: (2025)
MARRS: Masked Autoregressive Unit-based Reaction Synthesis
por: Wang, Yabiao, et al.
Publicado: (2025)
por: Wang, Yabiao, et al.
Publicado: (2025)
LLMs Meet VLMs: Boost Open Vocabulary Object Detection with Fine-grained Descriptors
por: Jin, Sheng, et al.
Publicado: (2024)
por: Jin, Sheng, et al.
Publicado: (2024)
CoherenDream: Boosting Holistic Text Coherence in 3D Generation via Multimodal Large Language Models Feedback
por: Jiang, Chenhan, et al.
Publicado: (2025)
por: Jiang, Chenhan, et al.
Publicado: (2025)
ArtWeaver: Advanced Dynamic Style Integration via Diffusion Model
por: Xu, Chengming, et al.
Publicado: (2024)
por: Xu, Chengming, et al.
Publicado: (2024)
Ejemplares similares
-
PointSeg: A Training-Free Paradigm for 3D Scene Segmentation via Foundation Models
por: He, Qingdong, et al.
Publicado: (2024) -
TokenAR: Multiple Subject Generation via Autoregressive Token-level enhancement
por: Sun, Haiyue, et al.
Publicado: (2025) -
Referring Multiple Regions with Large Multimodal Models via Contextual Latent Steering
por: Xing, Yun, et al.
Publicado: (2026) -
Human-MME: A Holistic Evaluation Benchmark for Human-Centric Multimodal Large Language Models
por: Liu, Yuansen, et al.
Publicado: (2025) -
IVEBench: Modern Benchmark Suite for Instruction-Guided Video Editing Assessment
por: Chen, Yinan, et al.
Publicado: (2025)