ETCHR: Editing To Clarify and Harness Reasoning
Fuente:
arXiv
Guardado en:
| Autores principales: | Zhang, Beichen, Liu, Yuhong, Li, Jinsong, Zang, Yuhang, Wang, Jiaqi, Lin, Dahua |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Think Visually, Reason Textually: Vision-Language Synergy in ARC
por: Zhang, Beichen, et al.
Publicado: (2025)
por: Zhang, Beichen, et al.
Publicado: (2025)
Spatial-SSRL: Enhancing Spatial Understanding via Self-Supervised Reinforcement Learning
por: Liu, Yuhong, et al.
Publicado: (2025)
por: Liu, Yuhong, et al.
Publicado: (2025)
CapRL: Stimulating Dense Image Caption Capabilities via Reinforcement Learning
por: Xing, Long, et al.
Publicado: (2025)
por: Xing, Long, et al.
Publicado: (2025)
SEAgent: Self-Evolving Computer Use Agent with Autonomous Learning from Experience
por: Sun, Zeyi, et al.
Publicado: (2025)
por: Sun, Zeyi, et al.
Publicado: (2025)
Make-it-Real: Unleashing Large Multimodal Model for Painting 3D Objects with Realistic Materials
por: Fang, Ye, et al.
Publicado: (2024)
por: Fang, Ye, et al.
Publicado: (2024)
EndoCoT: Scaling Endogenous Chain-of-Thought Reasoning in Diffusion Models
por: Dai, Xuanlang, et al.
Publicado: (2026)
por: Dai, Xuanlang, et al.
Publicado: (2026)
Visual Agentic Reinforcement Fine-Tuning
por: Liu, Ziyu, et al.
Publicado: (2025)
por: Liu, Ziyu, et al.
Publicado: (2025)
MIA-DPO: Multi-Image Augmented Direct Preference Optimization For Large Vision-Language Models
por: Liu, Ziyu, et al.
Publicado: (2024)
por: Liu, Ziyu, et al.
Publicado: (2024)
Advancing Complex Video Object Segmentation via Progressive Concept Construction
por: Zhang, Zhixiong, et al.
Publicado: (2025)
por: Zhang, Zhixiong, et al.
Publicado: (2025)
Visual Self-Refine: A Pixel-Guided Paradigm for Accurate Chart Parsing
por: Li, Jinsong, et al.
Publicado: (2026)
por: Li, Jinsong, et al.
Publicado: (2026)
InternLM-XComposer2.5-OmniLive: A Comprehensive Multimodal System for Long-term Streaming Video and Audio Interactions
por: Zhang, Pan, et al.
Publicado: (2024)
por: Zhang, Pan, et al.
Publicado: (2024)
VEGGIE: Instructional Editing and Reasoning Video Concepts with Grounded Generation
por: Yu, Shoubin, et al.
Publicado: (2025)
por: Yu, Shoubin, et al.
Publicado: (2025)
When language and vision meet road safety: leveraging multimodal large language models for video-based traffic accident analysis
por: Zhang, Ruixuan, et al.
Publicado: (2025)
por: Zhang, Ruixuan, et al.
Publicado: (2025)
BoostStep: Boosting mathematical capability of Large Language Models via improved single-step reasoning
por: Zhang, Beichen, et al.
Publicado: (2025)
por: Zhang, Beichen, et al.
Publicado: (2025)
Deciphering Cross-Modal Alignment in Large Vision-Language Models with Modality Integration Rate
por: Huang, Qidong, et al.
Publicado: (2024)
por: Huang, Qidong, et al.
Publicado: (2024)
ScaleCap: Inference-Time Scalable Image Captioning via Dual-Modality Debiasing
por: Xing, Long, et al.
Publicado: (2025)
por: Xing, Long, et al.
Publicado: (2025)
RBF++: Quantifying and Optimizing Reasoning Boundaries across Measurable and Unmeasurable Capabilities for Chain-of-Thought Reasoning
por: Chen, Qiguang, et al.
Publicado: (2025)
por: Chen, Qiguang, et al.
Publicado: (2025)
Visual-ERM: Reward Modeling for Visual Equivalence
por: Liu, Ziyu, et al.
Publicado: (2026)
por: Liu, Ziyu, et al.
Publicado: (2026)
PointLLM: Empowering Large Language Models to Understand Point Clouds
por: Xu, Runsen, et al.
Publicado: (2023)
por: Xu, Runsen, et al.
Publicado: (2023)
CaughtCheating: Is Your MLLM a Good Cheating Detective? Exploring the Boundary of Visual Perception and Reasoning
por: Li, Ming, et al.
Publicado: (2025)
por: Li, Ming, et al.
Publicado: (2025)
RAR: Retrieving And Ranking Augmented MLLMs for Visual Recognition
por: Liu, Ziyu, et al.
Publicado: (2024)
por: Liu, Ziyu, et al.
Publicado: (2024)
Error-Driven Scene Editing for 3D Grounding in Large Language Models
por: Zhang, Yue, et al.
Publicado: (2025)
por: Zhang, Yue, et al.
Publicado: (2025)
HIVE: Harnessing Human Feedback for Instructional Visual Editing
por: Zhang, Shu, et al.
Publicado: (2023)
por: Zhang, Shu, et al.
Publicado: (2023)
Bayesian Optimization for Controlled Image Editing via LLMs
por: Cai, Chengkun, et al.
Publicado: (2025)
por: Cai, Chengkun, et al.
Publicado: (2025)
Crafter: A Multi-Agent Harness for Editable Scientific Figure Generation from Diverse Inputs
por: Zhao, Haozhe, et al.
Publicado: (2026)
por: Zhao, Haozhe, et al.
Publicado: (2026)
CODA: Coordinating the Cerebrum and Cerebellum for a Dual-Brain Computer Use Agent with Decoupled Reinforcement Learning
por: Sun, Zeyi, et al.
Publicado: (2025)
por: Sun, Zeyi, et al.
Publicado: (2025)
ScanReason: Empowering 3D Visual Grounding with Reasoning Capabilities
por: Zhu, Chenming, et al.
Publicado: (2024)
por: Zhu, Chenming, et al.
Publicado: (2024)
Reinforcement Fine-Tuning Powers Reasoning Capability of Multimodal Large Language Models
por: Sun, Haoyuan, et al.
Publicado: (2025)
por: Sun, Haoyuan, et al.
Publicado: (2025)
Pixel Reasoner: Incentivizing Pixel-Space Reasoning with Curiosity-Driven Reinforcement Learning
por: Wang, Haozhe, et al.
Publicado: (2025)
por: Wang, Haozhe, et al.
Publicado: (2025)
PyramidDrop: Accelerating Your Large Vision-Language Models via Pyramid Visual Redundancy Reduction
por: Xing, Long, et al.
Publicado: (2024)
por: Xing, Long, et al.
Publicado: (2024)
VLKEB: A Large Vision-Language Model Knowledge Editing Benchmark
por: Huang, Han, et al.
Publicado: (2024)
por: Huang, Han, et al.
Publicado: (2024)
On Data Synthesis and Post-training for Visual Abstract Reasoning
por: Zhu, Ke, et al.
Publicado: (2025)
por: Zhu, Ke, et al.
Publicado: (2025)
VEFX-Bench: A Holistic Benchmark for Generic Video Editing and Visual Effects
por: Gao, Xiangbo, et al.
Publicado: (2026)
por: Gao, Xiangbo, et al.
Publicado: (2026)
MPN: Leveraging Multilingual Patch Neuron for Cross-lingual Model Editing
por: Si, Nianwen, et al.
Publicado: (2024)
por: Si, Nianwen, et al.
Publicado: (2024)
OneLLM: One Framework to Align All Modalities with Language
por: Han, Jiaming, et al.
Publicado: (2023)
por: Han, Jiaming, et al.
Publicado: (2023)
Echo-4o: Harnessing the Power of GPT-4o Synthetic Images for Improved Image Generation
por: Ye, Junyan, et al.
Publicado: (2025)
por: Ye, Junyan, et al.
Publicado: (2025)
AVG-LLaVA: An Efficient Large Multimodal Model with Adaptive Visual Granularity
por: Lan, Zhibin, et al.
Publicado: (2024)
por: Lan, Zhibin, et al.
Publicado: (2024)
Traceable Evidence Enhanced Visual Grounded Reasoning: Evaluation and Methodology
por: Wang, Haochen, et al.
Publicado: (2025)
por: Wang, Haochen, et al.
Publicado: (2025)
Chiron-o1: Igniting Multimodal Large Language Models towards Generalizable Medical Reasoning via Mentor-Intern Collaborative Search
por: Sun, Haoran, et al.
Publicado: (2025)
por: Sun, Haoran, et al.
Publicado: (2025)
Fostering Video Reasoning via Next-Event Prediction
por: Wang, Haonan, et al.
Publicado: (2025)
por: Wang, Haonan, et al.
Publicado: (2025)
Ejemplares similares
-
Think Visually, Reason Textually: Vision-Language Synergy in ARC
por: Zhang, Beichen, et al.
Publicado: (2025) -
Spatial-SSRL: Enhancing Spatial Understanding via Self-Supervised Reinforcement Learning
por: Liu, Yuhong, et al.
Publicado: (2025) -
CapRL: Stimulating Dense Image Caption Capabilities via Reinforcement Learning
por: Xing, Long, et al.
Publicado: (2025) -
SEAgent: Self-Evolving Computer Use Agent with Autonomous Learning from Experience
por: Sun, Zeyi, et al.
Publicado: (2025) -
Make-it-Real: Unleashing Large Multimodal Model for Painting 3D Objects with Realistic Materials
por: Fang, Ye, et al.
Publicado: (2024)