Clarification as Supervision: Reinforcement Learning for Vision-Language Interfaces
Fuente:
arXiv
Salvato in:
| Autori principali: | Gkountouras, John, Titov, Ivan |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
MORQA: Benchmarking Evaluation Metrics for Medical Open-Ended Question Answering
di: Yim, Wen-wai, et al.
Pubblicazione: (2025)
di: Yim, Wen-wai, et al.
Pubblicazione: (2025)
A Survey on Vision-Language-Action Models for Embodied AI
di: Ma, Yueen, et al.
Pubblicazione: (2024)
di: Ma, Yueen, et al.
Pubblicazione: (2024)
Unpacking Hateful Memes: Presupposed Context and False Claims
di: Cai, Weibin, et al.
Pubblicazione: (2025)
di: Cai, Weibin, et al.
Pubblicazione: (2025)
ATAAT: Adaptive Threat-Aware Adversarial Tuning Framework against Backdoor Attacks on Vision-Language-Action Models
di: Chen, Kewei, et al.
Pubblicazione: (2026)
di: Chen, Kewei, et al.
Pubblicazione: (2026)
A Hybrid Vision-Language Architecture for Automated Defect Reasoning and Report Generation in Industrial Inspection
di: Malikussaid, et al.
Pubblicazione: (2026)
di: Malikussaid, et al.
Pubblicazione: (2026)
Approaches to Semantic Textual Similarity in Slovak Language: From Algorithms to Transformers
di: Radosky, Lukas, et al.
Pubblicazione: (2026)
di: Radosky, Lukas, et al.
Pubblicazione: (2026)
FT-NCFM: An Influence-Aware Data Distillation Framework for Efficient VLA Models
di: Chen, Kewei, et al.
Pubblicazione: (2025)
di: Chen, Kewei, et al.
Pubblicazione: (2025)
Perception-Consistency Multimodal Large Language Models Reasoning via Caption-Regularized Policy Optimization
di: Tu, Songjun, et al.
Pubblicazione: (2025)
di: Tu, Songjun, et al.
Pubblicazione: (2025)
Does CLIP perceive art the same way we do?
di: Asperti, Andrea, et al.
Pubblicazione: (2025)
di: Asperti, Andrea, et al.
Pubblicazione: (2025)
TableMoE: Neuro-Symbolic Routing for Structured Expert Reasoning in Multimodal Table Understanding
di: Zhang, Junwen, et al.
Pubblicazione: (2025)
di: Zhang, Junwen, et al.
Pubblicazione: (2025)
RACAS: Controlling Diverse Robots With a Single Agentic System
di: Ashley, Dylan R., et al.
Pubblicazione: (2026)
di: Ashley, Dylan R., et al.
Pubblicazione: (2026)
Rule Extraction in Machine Learning: Chat Incremental Pattern Constructor
di: Nwokocha, Caleb Princewill
Pubblicazione: (2022)
di: Nwokocha, Caleb Princewill
Pubblicazione: (2022)
Biomedical Visual Instruction Tuning with Clinician Preference Alignment
di: Cui, Hejie, et al.
Pubblicazione: (2024)
di: Cui, Hejie, et al.
Pubblicazione: (2024)
CLEV: LLM-Based Evaluation Through Lightweight Efficient Voting for Free-Form Question-Answering
di: Badshah, Sher, et al.
Pubblicazione: (2025)
di: Badshah, Sher, et al.
Pubblicazione: (2025)
How much do LLMs learn from negative examples?
di: Hamdan, Shadi, et al.
Pubblicazione: (2025)
di: Hamdan, Shadi, et al.
Pubblicazione: (2025)
XAutoLM: Efficient Fine-Tuning of Language Models via Meta-Learning and AutoML
di: Estevanell-Valladares, Ernesto L., et al.
Pubblicazione: (2025)
di: Estevanell-Valladares, Ernesto L., et al.
Pubblicazione: (2025)
FrameFusion: Combining Similarity and Importance for Video Token Reduction on Large Vision Language Models
di: Fu, Tianyu, et al.
Pubblicazione: (2024)
di: Fu, Tianyu, et al.
Pubblicazione: (2024)
Evaluating Visual Mathematics in Multimodal LLMs: A Multilingual Benchmark Based on the Kangaroo Tests
di: Sáez, Arnau Igualde, et al.
Pubblicazione: (2025)
di: Sáez, Arnau Igualde, et al.
Pubblicazione: (2025)
Linguistic Collapse: Neural Collapse in (Large) Language Models
di: Wu, Robert, et al.
Pubblicazione: (2024)
di: Wu, Robert, et al.
Pubblicazione: (2024)
Smotrom tvoja pa ander drogoj verden! Resurrecting Dead Pidgin with Generative Models: Russenorsk Case Study
di: Tikhonov, Alexey, et al.
Pubblicazione: (2025)
di: Tikhonov, Alexey, et al.
Pubblicazione: (2025)
Context-Dependent Affordance Computation in Vision-Language Models
di: Farzulla, Murad
Pubblicazione: (2026)
di: Farzulla, Murad
Pubblicazione: (2026)
CogniLoad: A Synthetic Natural Language Reasoning Benchmark With Tunable Length, Intrinsic Difficulty, and Distractor Density
di: Kaiser, Daniel, et al.
Pubblicazione: (2025)
di: Kaiser, Daniel, et al.
Pubblicazione: (2025)
Waking Up Blind: Cold-Start Optimization of Supervision-Free Agentic Trajectories for Grounded Visual Perception
di: Bajpai, Ashutosh, et al.
Pubblicazione: (2026)
di: Bajpai, Ashutosh, et al.
Pubblicazione: (2026)
Hateful Meme Detection through Context-Sensitive Prompting and Fine-Grained Labeling
di: Ouyang, Rongxin, et al.
Pubblicazione: (2024)
di: Ouyang, Rongxin, et al.
Pubblicazione: (2024)
TowerVision: Understanding and Improving Multilinguality in Vision-Language Models
di: Viveiros, André G., et al.
Pubblicazione: (2025)
di: Viveiros, André G., et al.
Pubblicazione: (2025)
Do Reasoning Models Enhance Embedding Models?
di: Chan, Wun Yu, et al.
Pubblicazione: (2026)
di: Chan, Wun Yu, et al.
Pubblicazione: (2026)
Research on a hybrid LSTM-CNN-Attention model for text-based web content classification
di: Kuz, Mykola, et al.
Pubblicazione: (2025)
di: Kuz, Mykola, et al.
Pubblicazione: (2025)
Cost-Effective Attention Mechanisms for Low Resource Settings: Necessity & Sufficiency of Linear Transformations
di: Hosseini, Peyman, et al.
Pubblicazione: (2024)
di: Hosseini, Peyman, et al.
Pubblicazione: (2024)
TextTeacher: What Can Language Teach About Images?
di: Nauen, Tobias Christian, et al.
Pubblicazione: (2026)
di: Nauen, Tobias Christian, et al.
Pubblicazione: (2026)
ABot-Claw: A Foundation for Persistent, Cooperative, and Self-Evolving Robotic Agents
di: Huo, Dongjie, et al.
Pubblicazione: (2026)
di: Huo, Dongjie, et al.
Pubblicazione: (2026)
SUGARCREPE++ Dataset: Vision-Language Model Sensitivity to Semantic and Lexical Alterations
di: Dumpala, Sri Harsha, et al.
Pubblicazione: (2024)
di: Dumpala, Sri Harsha, et al.
Pubblicazione: (2024)
AI-based Drone Assisted Human Rescue in Disaster Environments: Challenges and Opportunities
di: Papyan, Narek, et al.
Pubblicazione: (2024)
di: Papyan, Narek, et al.
Pubblicazione: (2024)
No Memorization, No Detection: Output Distribution-Based Contamination Detection in Small Language Models
di: Sela, Omer
Pubblicazione: (2026)
di: Sela, Omer
Pubblicazione: (2026)
Harnessing non-adversarial robustness in large language models
di: Zhou, Qinghua, et al.
Pubblicazione: (2026)
di: Zhou, Qinghua, et al.
Pubblicazione: (2026)
LLM-supported document separation for printed reviews from zbMATH Open
di: Pluzhnikov, Ivan, et al.
Pubblicazione: (2026)
di: Pluzhnikov, Ivan, et al.
Pubblicazione: (2026)
Think, Act, Learn: A Framework for Autonomous Robotic Agents using Closed-Loop Large Language Models
di: Menon, Anjali R., et al.
Pubblicazione: (2025)
di: Menon, Anjali R., et al.
Pubblicazione: (2025)
The MSR-Video to Text Dataset with Clean Annotations
di: Chen, Haoran, et al.
Pubblicazione: (2021)
di: Chen, Haoran, et al.
Pubblicazione: (2021)
Mechanistic Analysis of Catastrophic Forgetting in Large Language Models During Continual Fine-tuning
di: Imanov, Olaf Yunus Laitinen
Pubblicazione: (2026)
di: Imanov, Olaf Yunus Laitinen
Pubblicazione: (2026)
Strategic Doctrine Language Models (sdLM): A Learning-System Framework for Doctrinal Consistency and Geopolitical Forecasting
di: Imanov, Olaf Yunus Laitinen, et al.
Pubblicazione: (2026)
di: Imanov, Olaf Yunus Laitinen, et al.
Pubblicazione: (2026)
From Noise to Diversity: Random Embedding Injection in LLM Reasoning
di: Kim, Heejun, et al.
Pubblicazione: (2026)
di: Kim, Heejun, et al.
Pubblicazione: (2026)
Documenti analoghi
-
MORQA: Benchmarking Evaluation Metrics for Medical Open-Ended Question Answering
di: Yim, Wen-wai, et al.
Pubblicazione: (2025) -
A Survey on Vision-Language-Action Models for Embodied AI
di: Ma, Yueen, et al.
Pubblicazione: (2024) -
Unpacking Hateful Memes: Presupposed Context and False Claims
di: Cai, Weibin, et al.
Pubblicazione: (2025) -
ATAAT: Adaptive Threat-Aware Adversarial Tuning Framework against Backdoor Attacks on Vision-Language-Action Models
di: Chen, Kewei, et al.
Pubblicazione: (2026) -
A Hybrid Vision-Language Architecture for Automated Defect Reasoning and Report Generation in Industrial Inspection
di: Malikussaid, et al.
Pubblicazione: (2026)