Unified Reinforcement and Imitation Learning for Vision-Language Models
Fuente:
arXiv
Guardado en:
| Autores principales: | Lee, Byung-Kwan, Hachiuma, Ryo, Ro, Yong Man, Wang, Yu-Chiang Frank, Wu, Yueh-Hua |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
VLsI: Verbalized Layers-to-Interactions from Large to Small Vision Language Models
por: Lee, Byung-Kwan, et al.
Publicado: (2024)
por: Lee, Byung-Kwan, et al.
Publicado: (2024)
Masking Teacher and Reinforcing Student for Distilling Vision-Language Models
por: Lee, Byung-Kwan, et al.
Publicado: (2025)
por: Lee, Byung-Kwan, et al.
Publicado: (2025)
SPARK: Multi-Vision Sensor Perception and Reasoning Benchmark for Large-scale Vision-Language Models
por: Yu, Youngjoon, et al.
Publicado: (2024)
por: Yu, Youngjoon, et al.
Publicado: (2024)
GenRecal: Generation after Recalibration from Large to Small Vision-Language Models
por: Lee, Byung-Kwan, et al.
Publicado: (2025)
por: Lee, Byung-Kwan, et al.
Publicado: (2025)
Meteor: Mamba-based Traversal of Rationale for Large Language and Vision Models
por: Lee, Byung-Kwan, et al.
Publicado: (2024)
por: Lee, Byung-Kwan, et al.
Publicado: (2024)
MoAI: Mixture of All Intelligence for Large Language and Vision Models
por: Lee, Byung-Kwan, et al.
Publicado: (2024)
por: Lee, Byung-Kwan, et al.
Publicado: (2024)
Phantom of Latent for Large Language and Vision Models
por: Lee, Byung-Kwan, et al.
Publicado: (2024)
por: Lee, Byung-Kwan, et al.
Publicado: (2024)
CoLLaVO: Crayon Large Language and Vision mOdel
por: Lee, Byung-Kwan, et al.
Publicado: (2024)
por: Lee, Byung-Kwan, et al.
Publicado: (2024)
TroL: Traversal of Layers for Large Language and Vision Models
por: Lee, Byung-Kwan, et al.
Publicado: (2024)
por: Lee, Byung-Kwan, et al.
Publicado: (2024)
Causal Unsupervised Semantic Segmentation
por: Kim, Junho, et al.
Publicado: (2023)
por: Kim, Junho, et al.
Publicado: (2023)
Zoom-Zero: Reinforced Coarse-to-Fine Video Understanding via Temporal Zoom-in
por: Shen, Xiaoqian, et al.
Publicado: (2025)
por: Shen, Xiaoqian, et al.
Publicado: (2025)
ThinkAct: Vision-Language-Action Reasoning via Reinforced Visual Latent Planning
por: Huang, Chi-Pin, et al.
Publicado: (2025)
por: Huang, Chi-Pin, et al.
Publicado: (2025)
VIOLA: Towards Video In-Context Learning with Minimal Annotations
por: Fujii, Ryo, et al.
Publicado: (2026)
por: Fujii, Ryo, et al.
Publicado: (2026)
V2V-LLM: Vehicle-to-Vehicle Cooperative Autonomous Driving with Multimodal Large Language Models
por: Chiu, Hsu-kuang, et al.
Publicado: (2025)
por: Chiu, Hsu-kuang, et al.
Publicado: (2025)
Omni-RGPT: Unifying Image and Video Region-level Understanding via Token Marks
por: Heo, Miran, et al.
Publicado: (2025)
por: Heo, Miran, et al.
Publicado: (2025)
RealTraj: Towards Real-World Pedestrian Trajectory Forecasting
por: Fujii, Ryo, et al.
Publicado: (2024)
por: Fujii, Ryo, et al.
Publicado: (2024)
Multimodal Cross-Domain Few-Shot Learning for Egocentric Action Recognition
por: Hatano, Masashi, et al.
Publicado: (2024)
por: Hatano, Masashi, et al.
Publicado: (2024)
Enhanced Vision-Language Models for Diverse Sensor Understanding: Cost-Efficient Optimization and Benchmarking
por: Chung, Sangyun, et al.
Publicado: (2024)
por: Chung, Sangyun, et al.
Publicado: (2024)
Interpretable Debiasing of Vision-Language Models for Social Fairness
por: An, Na Min, et al.
Publicado: (2026)
por: An, Na Min, et al.
Publicado: (2026)
Remote Sensing Large Vision-Language Model: Semantic-augmented Multi-level Alignment and Semantic-aware Expert Modeling
por: Park, Sungjune, et al.
Publicado: (2025)
por: Park, Sungjune, et al.
Publicado: (2025)
Autoregressive Universal Video Segmentation Model
por: Heo, Miran, et al.
Publicado: (2025)
por: Heo, Miran, et al.
Publicado: (2025)
SANER: Annotation-free Societal Attribute Neutralizer for Debiasing CLIP
por: Hirota, Yusuke, et al.
Publicado: (2024)
por: Hirota, Yusuke, et al.
Publicado: (2024)
Weakly Semi-supervised Tool Detection in Minimally Invasive Surgery Videos
por: Fujii, Ryo, et al.
Publicado: (2024)
por: Fujii, Ryo, et al.
Publicado: (2024)
EMAG: Ego-motion Aware and Generalizable 2D Hand Forecasting from Egocentric Videos
por: Hatano, Masashi, et al.
Publicado: (2024)
por: Hatano, Masashi, et al.
Publicado: (2024)
Human Preference-Aligned Concept Customization Benchmark via Decomposed Evaluation
por: Ishikawa, Reina, et al.
Publicado: (2025)
por: Ishikawa, Reina, et al.
Publicado: (2025)
CrowdMAC: Masked Crowd Density Completion for Robust Crowd Density Forecasting
por: Fujii, Ryo, et al.
Publicado: (2024)
por: Fujii, Ryo, et al.
Publicado: (2024)
Language-guided Learning for Object Detection Tackling Multiple Variations in Aerial Images
por: Park, Sungjune, et al.
Publicado: (2025)
por: Park, Sungjune, et al.
Publicado: (2025)
Integrating Language-Derived Appearance Elements with Visual Cues in Pedestrian Detection
por: Park, Sungjune, et al.
Publicado: (2023)
por: Park, Sungjune, et al.
Publicado: (2023)
ReFoCUS: Reinforcement-guided Frame Optimization for Contextual Understanding
por: Lee, Hosu, et al.
Publicado: (2025)
por: Lee, Hosu, et al.
Publicado: (2025)
4D-RGPT: Toward Region-level 4D Understanding via Perceptual Distillation
por: Yang, Chiao-An, et al.
Publicado: (2025)
por: Yang, Chiao-An, et al.
Publicado: (2025)
Revisiting Misalignment in Multispectral Pedestrian Detection: A Language-Driven Approach for Cross-modal Alignment Fusion
por: Kim, Taeheon, et al.
Publicado: (2024)
por: Kim, Taeheon, et al.
Publicado: (2024)
Towards Predicting Any Human Trajectory In Context
por: Fujii, Ryo, et al.
Publicado: (2025)
por: Fujii, Ryo, et al.
Publicado: (2025)
Histopathology Image Report Generation by Vision Language Model with Multimodal In-Context Learning
por: Liu, Shih-Wen, et al.
Publicado: (2025)
por: Liu, Shih-Wen, et al.
Publicado: (2025)
Robust Egocentric Visual Attention Prediction Through Language-guided Scene Context-aware Learning
por: Park, Sungjune, et al.
Publicado: (2026)
por: Park, Sungjune, et al.
Publicado: (2026)
QuarterMap: Efficient Post-Training Token Pruning for Visual State Space Models
por: Chi, Tien-Yu, et al.
Publicado: (2025)
por: Chi, Tien-Yu, et al.
Publicado: (2025)
Robust Pedestrian Detection via Constructing Versatile Pedestrian Knowledge Bank
por: Park, Sungjune, et al.
Publicado: (2024)
por: Park, Sungjune, et al.
Publicado: (2024)
LOTUS: A Leaderboard for Detailed Image Captioning from Quality to Societal Bias and User Preferences
por: Hirota, Yusuke, et al.
Publicado: (2025)
por: Hirota, Yusuke, et al.
Publicado: (2025)
Select and Distill: Selective Dual-Teacher Knowledge Transfer for Continual Learning on Vision-Language Models
por: Yu, Yu-Chu, et al.
Publicado: (2024)
por: Yu, Yu-Chu, et al.
Publicado: (2024)
From Descriptive Richness to Bias: Unveiling the Dark Side of Generative Image Caption Enrichment
por: Hirota, Yusuke, et al.
Publicado: (2024)
por: Hirota, Yusuke, et al.
Publicado: (2024)
FALCON: False-Negative Aware Learning of Contrastive Negatives in Vision-Language Alignment
por: Kim, Myunsoo, et al.
Publicado: (2025)
por: Kim, Myunsoo, et al.
Publicado: (2025)
Ejemplares similares
-
VLsI: Verbalized Layers-to-Interactions from Large to Small Vision Language Models
por: Lee, Byung-Kwan, et al.
Publicado: (2024) -
Masking Teacher and Reinforcing Student for Distilling Vision-Language Models
por: Lee, Byung-Kwan, et al.
Publicado: (2025) -
SPARK: Multi-Vision Sensor Perception and Reasoning Benchmark for Large-scale Vision-Language Models
por: Yu, Youngjoon, et al.
Publicado: (2024) -
GenRecal: Generation after Recalibration from Large to Small Vision-Language Models
por: Lee, Byung-Kwan, et al.
Publicado: (2025) -
Meteor: Mamba-based Traversal of Rationale for Large Language and Vision Models
por: Lee, Byung-Kwan, et al.
Publicado: (2024)