A Stepwise Distillation Learning Strategy for Non-differentiable Visual Programming Frameworks on Visual Reasoning Tasks
Fuente:
arXiv
Salvato in:
| Autori principali: | Wan, Wentao, Kang, Nan, Wang, Zeqing, Yang, Zhuojie, Lin, Liang, Wang, Keze |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2023
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Enhancing Visual Programming for Visual Reasoning via Probabilistic Graphs
di: Wan, Wentao, et al.
Pubblicazione: (2025)
di: Wan, Wentao, et al.
Pubblicazione: (2025)
Towards Top-Down Reasoning: An Explainable Multi-Agent Approach for Visual Question Answering
di: Wang, Zeqing, et al.
Pubblicazione: (2023)
di: Wang, Zeqing, et al.
Pubblicazione: (2023)
Is this Generated Person Existed in Real-world? Fine-grained Detecting and Calibrating Abnormal Human-body
di: Wang, Zeqing, et al.
Pubblicazione: (2024)
di: Wang, Zeqing, et al.
Pubblicazione: (2024)
PhyDetEx: Detecting and Explaining the Physical Plausibility of T2V Models
di: Wang, Zeqing, et al.
Pubblicazione: (2025)
di: Wang, Zeqing, et al.
Pubblicazione: (2025)
Adaptive-VoCo: Complexity-Aware Visual Token Compression for Vision-Language Models
di: Guo, Xiaoyang, et al.
Pubblicazione: (2025)
di: Guo, Xiaoyang, et al.
Pubblicazione: (2025)
Benchmarking Multimodal CoT Reward Model Stepwise by Visual Program
di: Gao, Minghe, et al.
Pubblicazione: (2025)
di: Gao, Minghe, et al.
Pubblicazione: (2025)
Exploiting Temporal Audio-Visual Correlation Embedding for Audio-Driven One-Shot Talking Head Animation
di: Xu, Zhihua, et al.
Pubblicazione: (2025)
di: Xu, Zhihua, et al.
Pubblicazione: (2025)
ResAgent: Entropy-based Prior Point Discovery and Visual Reasoning for Referring Expression Segmentation
di: Wang, Yihao, et al.
Pubblicazione: (2026)
di: Wang, Yihao, et al.
Pubblicazione: (2026)
UnAC: Adaptive Visual Prompting with Abstraction and Stepwise Checking for Complex Multimodal Reasoning
di: Wang, Yifan, et al.
Pubblicazione: (2026)
di: Wang, Yifan, et al.
Pubblicazione: (2026)
TimeCausality: Evaluating the Causal Ability in Time Dimension for Vision Language Models
di: Wang, Zeqing, et al.
Pubblicazione: (2025)
di: Wang, Zeqing, et al.
Pubblicazione: (2025)
Omni-o3: Deep Nested Omnimodal Deduction for Deliberative Audio-Visual Reasoning
di: Zhang, Zhicheng, et al.
Pubblicazione: (2026)
di: Zhang, Zhicheng, et al.
Pubblicazione: (2026)
VisualQuest: A Benchmark for Abstract Visual Reasoning in MLLMs
di: Xiao, Kelaiti, et al.
Pubblicazione: (2025)
di: Xiao, Kelaiti, et al.
Pubblicazione: (2025)
Visual Program Distillation: Distilling Tools and Programmatic Reasoning into Vision-Language Models
di: Hu, Yushi, et al.
Pubblicazione: (2023)
di: Hu, Yushi, et al.
Pubblicazione: (2023)
Self-Rewarded Multimodal Coherent Reasoning Across Diverse Visual Domains
di: Zhang, Jesen, et al.
Pubblicazione: (2025)
di: Zhang, Jesen, et al.
Pubblicazione: (2025)
ORACLE: Optimizing Reasoning Abilities of Large Language Models via Constraint-Led Synthetic Data Elicitation
di: Yang, Zhuojie, et al.
Pubblicazione: (2026)
di: Yang, Zhuojie, et al.
Pubblicazione: (2026)
Triage: Hierarchical Visual Budgeting for Efficient Video Reasoning in Vision-Language Models
di: Wang, Anmin, et al.
Pubblicazione: (2026)
di: Wang, Anmin, et al.
Pubblicazione: (2026)
Visual Program Distillation with Template-Based Augmentation
di: Shlapentokh-Rothman, Michal, et al.
Pubblicazione: (2024)
di: Shlapentokh-Rothman, Michal, et al.
Pubblicazione: (2024)
MM-CoT:A Benchmark for Probing Visual Chain-of-Thought Reasoning in Multimodal Models
di: Zhang, Jusheng, et al.
Pubblicazione: (2025)
di: Zhang, Jusheng, et al.
Pubblicazione: (2025)
FlashVLM: Text-Guided Visual Token Selection for Large Multimodal Models
di: Cai, Kaitong, et al.
Pubblicazione: (2025)
di: Cai, Kaitong, et al.
Pubblicazione: (2025)
Trust-Aware Diversion for Data-Effective Distillation
di: Wu, Zhuojie, et al.
Pubblicazione: (2025)
di: Wu, Zhuojie, et al.
Pubblicazione: (2025)
Competitive Distillation: A Simple Learning Strategy for Improving Visual Classification
di: Shi, Daqian, et al.
Pubblicazione: (2025)
di: Shi, Daqian, et al.
Pubblicazione: (2025)
Evaluating Robustness of Visual Representations for Object Assembly Task Requiring Spatio-Geometrical Reasoning
di: Ku, Chahyon, et al.
Pubblicazione: (2023)
di: Ku, Chahyon, et al.
Pubblicazione: (2023)
InterSketch: An Interleaved Reasoning Model with Self-correcting Visual Sketch and Stepwise Reward
di: Ning, Zhiwei, et al.
Pubblicazione: (2026)
di: Ning, Zhiwei, et al.
Pubblicazione: (2026)
Learning Only with Images: Visual Reinforcement Learning with Reasoning, Rendering, and Visual Feedback
di: Chen, Yang, et al.
Pubblicazione: (2025)
di: Chen, Yang, et al.
Pubblicazione: (2025)
Mimic Human Cognition, Master Multi-Image Reasoning: A Meta-Action Framework for Enhanced Visual Understanding
di: Yin, Jianghao, et al.
Pubblicazione: (2026)
di: Yin, Jianghao, et al.
Pubblicazione: (2026)
Elevating Visual Perception in Multimodal LLMs with Visual Embedding Distillation
di: Jain, Jitesh, et al.
Pubblicazione: (2024)
di: Jain, Jitesh, et al.
Pubblicazione: (2024)
RVTBench: A Benchmark for Visual Reasoning Tasks
di: Shen, Yiqing, et al.
Pubblicazione: (2025)
di: Shen, Yiqing, et al.
Pubblicazione: (2025)
SR-FoT: A Syllogistic-Reasoning Framework of Thought for Large Language Models Tackling Knowledge-based Reasoning Tasks
di: Wan, Wentao, et al.
Pubblicazione: (2025)
di: Wan, Wentao, et al.
Pubblicazione: (2025)
VideoVerse: Does Your T2V Generator Have World Model Capability to Synthesize Videos?
di: Wang, Zeqing, et al.
Pubblicazione: (2025)
di: Wang, Zeqing, et al.
Pubblicazione: (2025)
GMC: A General Framework of Multi-stage Context Learning and Utilization for Visual Detection Tasks
di: Wang, Xuan, et al.
Pubblicazione: (2024)
di: Wang, Xuan, et al.
Pubblicazione: (2024)
Visual Reasoning through Tool-supervised Reinforcement Learning
di: Dong, Qihua, et al.
Pubblicazione: (2026)
di: Dong, Qihua, et al.
Pubblicazione: (2026)
Multi-Teacher Knowledge Distillation with Reinforcement Learning for Visual Recognition
di: Yang, Chuanguang, et al.
Pubblicazione: (2025)
di: Yang, Chuanguang, et al.
Pubblicazione: (2025)
Progressive Language-guided Visual Learning for Multi-Task Visual Grounding
di: Wang, Jingchao, et al.
Pubblicazione: (2025)
di: Wang, Jingchao, et al.
Pubblicazione: (2025)
On Good Practices for Task-Specific Distillation of Large Pretrained Visual Models
di: Marrie, Juliette, et al.
Pubblicazione: (2024)
di: Marrie, Juliette, et al.
Pubblicazione: (2024)
Smooth and Stepwise Self-Distillation for Object Detection
di: Deng, Jieren, et al.
Pubblicazione: (2023)
di: Deng, Jieren, et al.
Pubblicazione: (2023)
AbductiveMLLM: Boosting Visual Abductive Reasoning Within MLLMs
di: Chang, Boyu, et al.
Pubblicazione: (2026)
di: Chang, Boyu, et al.
Pubblicazione: (2026)
VisualLens: Personalization through Task-Agnostic Visual History
di: Zhu, Wang Bill, et al.
Pubblicazione: (2024)
di: Zhu, Wang Bill, et al.
Pubblicazione: (2024)
CausalStep: A Benchmark for Explicit Stepwise Causal Reasoning in Videos
di: Li, Xuchen, et al.
Pubblicazione: (2025)
di: Li, Xuchen, et al.
Pubblicazione: (2025)
Selftok: Discrete Visual Tokens of Autoregression, by Diffusion, and for Reasoning
di: Wang, Bohan, et al.
Pubblicazione: (2025)
di: Wang, Bohan, et al.
Pubblicazione: (2025)
Monet: Reasoning in Latent Visual Space Beyond Images and Language
di: Wang, Qixun, et al.
Pubblicazione: (2025)
di: Wang, Qixun, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Enhancing Visual Programming for Visual Reasoning via Probabilistic Graphs
di: Wan, Wentao, et al.
Pubblicazione: (2025) -
Towards Top-Down Reasoning: An Explainable Multi-Agent Approach for Visual Question Answering
di: Wang, Zeqing, et al.
Pubblicazione: (2023) -
Is this Generated Person Existed in Real-world? Fine-grained Detecting and Calibrating Abnormal Human-body
di: Wang, Zeqing, et al.
Pubblicazione: (2024) -
PhyDetEx: Detecting and Explaining the Physical Plausibility of T2V Models
di: Wang, Zeqing, et al.
Pubblicazione: (2025) -
Adaptive-VoCo: Complexity-Aware Visual Token Compression for Vision-Language Models
di: Guo, Xiaoyang, et al.
Pubblicazione: (2025)