Clarification as Supervision: Reinforcement Learning for Vision-Language Interfaces
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Gkountouras, John, Titov, Ivan |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
MORQA: Benchmarking Evaluation Metrics for Medical Open-Ended Question Answering
par: Yim, Wen-wai, et autres
Publié: (2025)
par: Yim, Wen-wai, et autres
Publié: (2025)
A Survey on Vision-Language-Action Models for Embodied AI
par: Ma, Yueen, et autres
Publié: (2024)
par: Ma, Yueen, et autres
Publié: (2024)
Unpacking Hateful Memes: Presupposed Context and False Claims
par: Cai, Weibin, et autres
Publié: (2025)
par: Cai, Weibin, et autres
Publié: (2025)
ATAAT: Adaptive Threat-Aware Adversarial Tuning Framework against Backdoor Attacks on Vision-Language-Action Models
par: Chen, Kewei, et autres
Publié: (2026)
par: Chen, Kewei, et autres
Publié: (2026)
A Hybrid Vision-Language Architecture for Automated Defect Reasoning and Report Generation in Industrial Inspection
par: Malikussaid, et autres
Publié: (2026)
par: Malikussaid, et autres
Publié: (2026)
Approaches to Semantic Textual Similarity in Slovak Language: From Algorithms to Transformers
par: Radosky, Lukas, et autres
Publié: (2026)
par: Radosky, Lukas, et autres
Publié: (2026)
FT-NCFM: An Influence-Aware Data Distillation Framework for Efficient VLA Models
par: Chen, Kewei, et autres
Publié: (2025)
par: Chen, Kewei, et autres
Publié: (2025)
Perception-Consistency Multimodal Large Language Models Reasoning via Caption-Regularized Policy Optimization
par: Tu, Songjun, et autres
Publié: (2025)
par: Tu, Songjun, et autres
Publié: (2025)
Does CLIP perceive art the same way we do?
par: Asperti, Andrea, et autres
Publié: (2025)
par: Asperti, Andrea, et autres
Publié: (2025)
TableMoE: Neuro-Symbolic Routing for Structured Expert Reasoning in Multimodal Table Understanding
par: Zhang, Junwen, et autres
Publié: (2025)
par: Zhang, Junwen, et autres
Publié: (2025)
RACAS: Controlling Diverse Robots With a Single Agentic System
par: Ashley, Dylan R., et autres
Publié: (2026)
par: Ashley, Dylan R., et autres
Publié: (2026)
Rule Extraction in Machine Learning: Chat Incremental Pattern Constructor
par: Nwokocha, Caleb Princewill
Publié: (2022)
par: Nwokocha, Caleb Princewill
Publié: (2022)
Biomedical Visual Instruction Tuning with Clinician Preference Alignment
par: Cui, Hejie, et autres
Publié: (2024)
par: Cui, Hejie, et autres
Publié: (2024)
CLEV: LLM-Based Evaluation Through Lightweight Efficient Voting for Free-Form Question-Answering
par: Badshah, Sher, et autres
Publié: (2025)
par: Badshah, Sher, et autres
Publié: (2025)
How much do LLMs learn from negative examples?
par: Hamdan, Shadi, et autres
Publié: (2025)
par: Hamdan, Shadi, et autres
Publié: (2025)
XAutoLM: Efficient Fine-Tuning of Language Models via Meta-Learning and AutoML
par: Estevanell-Valladares, Ernesto L., et autres
Publié: (2025)
par: Estevanell-Valladares, Ernesto L., et autres
Publié: (2025)
FrameFusion: Combining Similarity and Importance for Video Token Reduction on Large Vision Language Models
par: Fu, Tianyu, et autres
Publié: (2024)
par: Fu, Tianyu, et autres
Publié: (2024)
Evaluating Visual Mathematics in Multimodal LLMs: A Multilingual Benchmark Based on the Kangaroo Tests
par: Sáez, Arnau Igualde, et autres
Publié: (2025)
par: Sáez, Arnau Igualde, et autres
Publié: (2025)
Linguistic Collapse: Neural Collapse in (Large) Language Models
par: Wu, Robert, et autres
Publié: (2024)
par: Wu, Robert, et autres
Publié: (2024)
Smotrom tvoja pa ander drogoj verden! Resurrecting Dead Pidgin with Generative Models: Russenorsk Case Study
par: Tikhonov, Alexey, et autres
Publié: (2025)
par: Tikhonov, Alexey, et autres
Publié: (2025)
Context-Dependent Affordance Computation in Vision-Language Models
par: Farzulla, Murad
Publié: (2026)
par: Farzulla, Murad
Publié: (2026)
CogniLoad: A Synthetic Natural Language Reasoning Benchmark With Tunable Length, Intrinsic Difficulty, and Distractor Density
par: Kaiser, Daniel, et autres
Publié: (2025)
par: Kaiser, Daniel, et autres
Publié: (2025)
Waking Up Blind: Cold-Start Optimization of Supervision-Free Agentic Trajectories for Grounded Visual Perception
par: Bajpai, Ashutosh, et autres
Publié: (2026)
par: Bajpai, Ashutosh, et autres
Publié: (2026)
Hateful Meme Detection through Context-Sensitive Prompting and Fine-Grained Labeling
par: Ouyang, Rongxin, et autres
Publié: (2024)
par: Ouyang, Rongxin, et autres
Publié: (2024)
TowerVision: Understanding and Improving Multilinguality in Vision-Language Models
par: Viveiros, André G., et autres
Publié: (2025)
par: Viveiros, André G., et autres
Publié: (2025)
Do Reasoning Models Enhance Embedding Models?
par: Chan, Wun Yu, et autres
Publié: (2026)
par: Chan, Wun Yu, et autres
Publié: (2026)
Research on a hybrid LSTM-CNN-Attention model for text-based web content classification
par: Kuz, Mykola, et autres
Publié: (2025)
par: Kuz, Mykola, et autres
Publié: (2025)
Cost-Effective Attention Mechanisms for Low Resource Settings: Necessity & Sufficiency of Linear Transformations
par: Hosseini, Peyman, et autres
Publié: (2024)
par: Hosseini, Peyman, et autres
Publié: (2024)
TextTeacher: What Can Language Teach About Images?
par: Nauen, Tobias Christian, et autres
Publié: (2026)
par: Nauen, Tobias Christian, et autres
Publié: (2026)
ABot-Claw: A Foundation for Persistent, Cooperative, and Self-Evolving Robotic Agents
par: Huo, Dongjie, et autres
Publié: (2026)
par: Huo, Dongjie, et autres
Publié: (2026)
SUGARCREPE++ Dataset: Vision-Language Model Sensitivity to Semantic and Lexical Alterations
par: Dumpala, Sri Harsha, et autres
Publié: (2024)
par: Dumpala, Sri Harsha, et autres
Publié: (2024)
AI-based Drone Assisted Human Rescue in Disaster Environments: Challenges and Opportunities
par: Papyan, Narek, et autres
Publié: (2024)
par: Papyan, Narek, et autres
Publié: (2024)
No Memorization, No Detection: Output Distribution-Based Contamination Detection in Small Language Models
par: Sela, Omer
Publié: (2026)
par: Sela, Omer
Publié: (2026)
Harnessing non-adversarial robustness in large language models
par: Zhou, Qinghua, et autres
Publié: (2026)
par: Zhou, Qinghua, et autres
Publié: (2026)
LLM-supported document separation for printed reviews from zbMATH Open
par: Pluzhnikov, Ivan, et autres
Publié: (2026)
par: Pluzhnikov, Ivan, et autres
Publié: (2026)
Think, Act, Learn: A Framework for Autonomous Robotic Agents using Closed-Loop Large Language Models
par: Menon, Anjali R., et autres
Publié: (2025)
par: Menon, Anjali R., et autres
Publié: (2025)
The MSR-Video to Text Dataset with Clean Annotations
par: Chen, Haoran, et autres
Publié: (2021)
par: Chen, Haoran, et autres
Publié: (2021)
Mechanistic Analysis of Catastrophic Forgetting in Large Language Models During Continual Fine-tuning
par: Imanov, Olaf Yunus Laitinen
Publié: (2026)
par: Imanov, Olaf Yunus Laitinen
Publié: (2026)
Strategic Doctrine Language Models (sdLM): A Learning-System Framework for Doctrinal Consistency and Geopolitical Forecasting
par: Imanov, Olaf Yunus Laitinen, et autres
Publié: (2026)
par: Imanov, Olaf Yunus Laitinen, et autres
Publié: (2026)
From Noise to Diversity: Random Embedding Injection in LLM Reasoning
par: Kim, Heejun, et autres
Publié: (2026)
par: Kim, Heejun, et autres
Publié: (2026)
Documents similaires
-
MORQA: Benchmarking Evaluation Metrics for Medical Open-Ended Question Answering
par: Yim, Wen-wai, et autres
Publié: (2025) -
A Survey on Vision-Language-Action Models for Embodied AI
par: Ma, Yueen, et autres
Publié: (2024) -
Unpacking Hateful Memes: Presupposed Context and False Claims
par: Cai, Weibin, et autres
Publié: (2025) -
ATAAT: Adaptive Threat-Aware Adversarial Tuning Framework against Backdoor Attacks on Vision-Language-Action Models
par: Chen, Kewei, et autres
Publié: (2026) -
A Hybrid Vision-Language Architecture for Automated Defect Reasoning and Report Generation in Industrial Inspection
par: Malikussaid, et autres
Publié: (2026)