Decomposed On-Policy Distillation for Vision-Language Reasoning: Steering Gradients for Visual Grounding
Fuente:
arXiv
Guardado en:
| Autores principales: | Yoon, Hee Suk, Yoon, Eunseop, Jang, Jaehyun, Eom, SooHwan, Hong, Ji Woo, Hasegawa-Johnson, Mark, Dai, Qi, Luo, Chong, Yoo, Chang D. |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
PDCR: Perception-Decomposed Confidence Reward for Vision-Language Reasoning
por: Yoon, Hee Suk, et al.
Publicado: (2026)
por: Yoon, Hee Suk, et al.
Publicado: (2026)
PACR: Progressively Ascending Confidence Reward for LLM Reasoning
por: Yoon, Eunseop, et al.
Publicado: (2025)
por: Yoon, Eunseop, et al.
Publicado: (2025)
High-Fidelity Text-to-Image Generation from Pre-Trained Vision-Language Models via Distribution-Conditioned Diffusion Decoding
por: Hong, Ji Woo, et al.
Publicado: (2026)
por: Hong, Ji Woo, et al.
Publicado: (2026)
AdaMER-CTC: Connectionist Temporal Classification with Adaptive Maximum Entropy Regularization for Automatic Speech Recognition
por: Eom, SooHwan, et al.
Publicado: (2024)
por: Eom, SooHwan, et al.
Publicado: (2024)
TLCR: Token-Level Continuous Reward for Fine-grained Reinforcement Learning from Human Feedback
por: Yoon, Eunseop, et al.
Publicado: (2024)
por: Yoon, Eunseop, et al.
Publicado: (2024)
Can Video LLMs Refuse to Answer? Alignment for Answerability in Video Large Language Models
por: Yoon, Eunseop, et al.
Publicado: (2025)
por: Yoon, Eunseop, et al.
Publicado: (2025)
ConfPO: Exploiting Policy Model Confidence for Critical Token Selection in Preference Optimization
por: Yoon, Hee Suk, et al.
Publicado: (2025)
por: Yoon, Hee Suk, et al.
Publicado: (2025)
LI-TTA: Language Informed Test-Time Adaptation for Automatic Speech Recognition
por: Yoon, Eunseop, et al.
Publicado: (2024)
por: Yoon, Eunseop, et al.
Publicado: (2024)
C-TPT: Calibrated Test-Time Prompt Tuning for Vision-Language Models via Text Feature Dispersion
por: Yoon, Hee Suk, et al.
Publicado: (2024)
por: Yoon, Hee Suk, et al.
Publicado: (2024)
Selective Query-guided Debiasing for Video Corpus Moment Retrieval
por: Yoon, Sunjae, et al.
Publicado: (2022)
por: Yoon, Sunjae, et al.
Publicado: (2022)
HEAR: Hearing Enhanced Audio Response for Video-grounded Dialogue
por: Yoon, Sunjae, et al.
Publicado: (2023)
por: Yoon, Sunjae, et al.
Publicado: (2023)
SiamCTC: Learning Speech Representations through Monotonic Temporal Alignment
por: Eom, SooHwan, et al.
Publicado: (2026)
por: Eom, SooHwan, et al.
Publicado: (2026)
ESD: Expected Squared Difference as a Tuning-Free Trainable Calibration Measure
por: Yoon, Hee Suk, et al.
Publicado: (2023)
por: Yoon, Hee Suk, et al.
Publicado: (2023)
Zero-Shot Dual-Path Integration Framework for Open-Vocabulary 3D Instance Segmentation
por: Ton, Tri, et al.
Publicado: (2024)
por: Ton, Tri, et al.
Publicado: (2024)
SimPSI: A Simple Strategy to Preserve Spectral Information in Time Series Data Augmentation
por: Ryu, Hyun, et al.
Publicado: (2023)
por: Ryu, Hyun, et al.
Publicado: (2023)
CLST: Cold-Start Mitigation in Knowledge Tracing by Aligning a Generative Language Model as a Students' Knowledge Tracer
por: Jung, Heeseok, et al.
Publicado: (2024)
por: Jung, Heeseok, et al.
Publicado: (2024)
Doc-PP: Document Policy Preservation Benchmark for Large Vision-Language Models
por: Jang, Haeun, et al.
Publicado: (2026)
por: Jang, Haeun, et al.
Publicado: (2026)
Improve Student's Reasoning Generalizability through Cascading Decomposed CoTs Distillation
por: Dai, Chengwei, et al.
Publicado: (2024)
por: Dai, Chengwei, et al.
Publicado: (2024)
BridG MT: Enhancing LLMs' Machine Translation Capabilities with Sentence Bridging and Gradual MT
por: Choi, Seung-Woo, et al.
Publicado: (2024)
por: Choi, Seung-Woo, et al.
Publicado: (2024)
TERDNet: Transformer Encoder-Recurrent Decoder Network for Scene Change Detection
por: Yoon, Jiae, et al.
Publicado: (2026)
por: Yoon, Jiae, et al.
Publicado: (2026)
HuBERT-EE: Early Exiting HuBERT for Efficient Speech Recognition
por: Yoon, Ji Won, et al.
Publicado: (2022)
por: Yoon, Ji Won, et al.
Publicado: (2022)
Multimodal Distribution Matching for Vision-Language Dataset Distillation
por: Jeong, Jongoh, et al.
Publicado: (2026)
por: Jeong, Jongoh, et al.
Publicado: (2026)
GMT: Enhancing Generalizable Neural Rendering via Geometry-Driven Multi-Reference Texture Transfer
por: Yoon, Youngho, et al.
Publicado: (2024)
por: Yoon, Youngho, et al.
Publicado: (2024)
SALSA: Speech Aware LLM Adaptation via Learned Steering Activation Vectors
por: Yegorova, Yekaterina, et al.
Publicado: (2026)
por: Yegorova, Yekaterina, et al.
Publicado: (2026)
DNI: Dilutional Noise Initialization for Diffusion Video Editing
por: Yoon, Sunjae, et al.
Publicado: (2024)
por: Yoon, Sunjae, et al.
Publicado: (2024)
FlexiEdit: Frequency-Aware Latent Refinement for Enhanced Non-Rigid Editing
por: Koo, Gwanhyeong, et al.
Publicado: (2024)
por: Koo, Gwanhyeong, et al.
Publicado: (2024)
Do MLLMs Capture How Interfaces Guide User Behavior? A Benchmark for Multimodal UI/UX Design Understanding
por: Jeon, Jaehyun, et al.
Publicado: (2025)
por: Jeon, Jaehyun, et al.
Publicado: (2025)
Vision Transformers with Self-Distilled Registers
por: Chen, Yinjie, et al.
Publicado: (2025)
por: Chen, Yinjie, et al.
Publicado: (2025)
NOVO: Bridging LLaVA and SAM with Visual-only Prompts for Reasoning Segmentation
por: Yoon, Kyung-Yoon, et al.
Publicado: (2025)
por: Yoon, Kyung-Yoon, et al.
Publicado: (2025)
QE-EBM: Using Quality Estimators as Energy Loss for Machine Translation
por: Yoo, Gahyun, et al.
Publicado: (2024)
por: Yoo, Gahyun, et al.
Publicado: (2024)
Decomposing and Steering Functional Metacognition in Large Language Models
por: Li, Yanshi, et al.
Publicado: (2026)
por: Li, Yanshi, et al.
Publicado: (2026)
BI-MDRG: Bridging Image History in Multimodal Dialogue Response Generation
por: Yoon, Hee Suk, et al.
Publicado: (2024)
por: Yoon, Hee Suk, et al.
Publicado: (2024)
Large Language Models Facilitate Vision Reflection in Image Classification
por: An, Guoyuan, et al.
Publicado: (2025)
por: An, Guoyuan, et al.
Publicado: (2025)
CountSteer: Steering Attention for Object Counting in Diffusion Models
por: Boo, Hyemin, et al.
Publicado: (2025)
por: Boo, Hyemin, et al.
Publicado: (2025)
Confidence-guided Refinement Reasoning for Zero-shot Question Answering
por: Jang, Youwon, et al.
Publicado: (2025)
por: Jang, Youwon, et al.
Publicado: (2025)
Decomposing Complex Visual Comprehension into Atomic Visual Skills for Vision Language Models
por: Chae, Hyunsik, et al.
Publicado: (2025)
por: Chae, Hyunsik, et al.
Publicado: (2025)
SafeSteer: Localized On-Policy Distillation for Efficient Safety Alignment
por: Li, Hao, et al.
Publicado: (2026)
por: Li, Hao, et al.
Publicado: (2026)
$MV_{Hybrid}$: Improving Spatial Transcriptomics Prediction with Hybrid State Space-Vision Transformer Backbone in Pathology Vision Foundation Models
por: Cho, Won June, et al.
Publicado: (2025)
por: Cho, Won June, et al.
Publicado: (2025)
LangBridge: Multilingual Reasoning Without Multilingual Supervision
por: Yoon, Dongkeun, et al.
Publicado: (2024)
por: Yoon, Dongkeun, et al.
Publicado: (2024)
Superpixel Tokenization for Vision Transformers: Preserving Semantic Integrity in Visual Tokens
por: Lew, Jaihyun, et al.
Publicado: (2024)
por: Lew, Jaihyun, et al.
Publicado: (2024)
Ejemplares similares
-
PDCR: Perception-Decomposed Confidence Reward for Vision-Language Reasoning
por: Yoon, Hee Suk, et al.
Publicado: (2026) -
PACR: Progressively Ascending Confidence Reward for LLM Reasoning
por: Yoon, Eunseop, et al.
Publicado: (2025) -
High-Fidelity Text-to-Image Generation from Pre-Trained Vision-Language Models via Distribution-Conditioned Diffusion Decoding
por: Hong, Ji Woo, et al.
Publicado: (2026) -
AdaMER-CTC: Connectionist Temporal Classification with Adaptive Maximum Entropy Regularization for Automatic Speech Recognition
por: Eom, SooHwan, et al.
Publicado: (2024) -
TLCR: Token-Level Continuous Reward for Fine-grained Reinforcement Learning from Human Feedback
por: Yoon, Eunseop, et al.
Publicado: (2024)