Self-Improving VLM Judges Without Human Annotations
Fuente:
arXiv
Salvato in:
| Autori principali: | Lin, Inna Wanyin, Hu, Yushi, Li, Shuyue Stella, Geng, Scott, Koh, Pang Wei, Zettlemoyer, Luke, Althoff, Tim, Ghazvininejad, Marjan |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Multimodal RewardBench: Holistic Evaluation of Reward Models for Vision Language Models
di: Yasunaga, Michihiro, et al.
Pubblicazione: (2025)
di: Yasunaga, Michihiro, et al.
Pubblicazione: (2025)
GenEval 2: Addressing Benchmark Drift in Text-to-Image Evaluation
di: Kamath, Amita, et al.
Pubblicazione: (2025)
di: Kamath, Amita, et al.
Pubblicazione: (2025)
Multimodal RewardBench 2: Evaluating Omni Reward Models for Interleaved Text and Image
di: Hu, Yushi, et al.
Pubblicazione: (2025)
di: Hu, Yushi, et al.
Pubblicazione: (2025)
Facilitating Self-Guided Mental Health Interventions Through Human-Language Model Interaction: A Case Study of Cognitive Restructuring
di: Sharma, Ashish, et al.
Pubblicazione: (2023)
di: Sharma, Ashish, et al.
Pubblicazione: (2023)
ALMA: Alignment with Minimal Annotation
di: Yasunaga, Michihiro, et al.
Pubblicazione: (2024)
di: Yasunaga, Michihiro, et al.
Pubblicazione: (2024)
IMBUE: Improving Interpersonal Effectiveness through Simulation and Just-in-time Feedback with Human-Language Model Interaction
di: Lin, Inna Wanyin, et al.
Pubblicazione: (2024)
di: Lin, Inna Wanyin, et al.
Pubblicazione: (2024)
JPEG-LM: LLMs as Image Generators with Canonical Codec Representations
di: Han, Xiaochuang, et al.
Pubblicazione: (2024)
di: Han, Xiaochuang, et al.
Pubblicazione: (2024)
A Computational Framework for Behavioral Assessment of LLM Therapists
di: Chiu, Yu Ying, et al.
Pubblicazione: (2024)
di: Chiu, Yu Ying, et al.
Pubblicazione: (2024)
Learning to Plan & Reason for Evaluation with Thinking-LLM-as-a-Judge
di: Saha, Swarnadeep, et al.
Pubblicazione: (2025)
di: Saha, Swarnadeep, et al.
Pubblicazione: (2025)
Unified Text-Image Generation with Weakness-Targeted Post-Training
di: Chen, Jiahui, et al.
Pubblicazione: (2026)
di: Chen, Jiahui, et al.
Pubblicazione: (2026)
CandorMD: An AI-Assisted Audio Simulation and Feedback System for Training Clinicians for Medical Error Disclosure
di: Lin, Inna Wanyin, et al.
Pubblicazione: (2026)
di: Lin, Inna Wanyin, et al.
Pubblicazione: (2026)
Representation Deficiency in Masked Language Modeling
di: Meng, Yu, et al.
Pubblicazione: (2023)
di: Meng, Yu, et al.
Pubblicazione: (2023)
A Visually Impaired Assistance Benchmark for VLM-as-a-Judge Evaluation
di: Zhao, Yi, et al.
Pubblicazione: (2026)
di: Zhao, Yi, et al.
Pubblicazione: (2026)
Precise Information Control in Long-Form Text Generation
di: He, Jacqueline, et al.
Pubblicazione: (2025)
di: He, Jacqueline, et al.
Pubblicazione: (2025)
RISE: Enhancing VLM Image Annotation with Self-Supervised Reasoning
di: Hu, Suhang, et al.
Pubblicazione: (2025)
di: Hu, Suhang, et al.
Pubblicazione: (2025)
Spurious Rewards: Rethinking Training Signals in RLVR
di: Shao, Rulin, et al.
Pubblicazione: (2025)
di: Shao, Rulin, et al.
Pubblicazione: (2025)
AutoJudge: Judge Decoding Without Manual Annotation
di: Garipov, Roman, et al.
Pubblicazione: (2025)
di: Garipov, Roman, et al.
Pubblicazione: (2025)
David helps Goliath: Inference-Time Collaboration Between Small Specialized and Large General Diffusion LMs
di: Han, Xiaochuang, et al.
Pubblicazione: (2023)
di: Han, Xiaochuang, et al.
Pubblicazione: (2023)
reWordBench: Benchmarking and Improving the Robustness of Reward Models with Transformed Inputs
di: Wu, Zhaofeng, et al.
Pubblicazione: (2025)
di: Wu, Zhaofeng, et al.
Pubblicazione: (2025)
Scaling Retrieval-Based Language Models with a Trillion-Token Datastore
di: Shao, Rulin, et al.
Pubblicazione: (2024)
di: Shao, Rulin, et al.
Pubblicazione: (2024)
Anchored Decoding: Provably Reducing Copyright Risk for Any Language Model
di: He, Jacqueline, et al.
Pubblicazione: (2026)
di: He, Jacqueline, et al.
Pubblicazione: (2026)
Annotation alignment: Comparing LLM and human annotations of conversational safety
di: Movva, Rajiv, et al.
Pubblicazione: (2024)
di: Movva, Rajiv, et al.
Pubblicazione: (2024)
Reliable, Adaptable, and Attributable Language Models with Retrieval
di: Asai, Akari, et al.
Pubblicazione: (2024)
di: Asai, Akari, et al.
Pubblicazione: (2024)
Can External Validation Tools Improve Annotation Quality for LLM-as-a-Judge?
di: Findeis, Arduin, et al.
Pubblicazione: (2025)
di: Findeis, Arduin, et al.
Pubblicazione: (2025)
MediQ: Question-Asking LLMs and a Benchmark for Reliable Interactive Clinical Reasoning
di: Li, Shuyue Stella, et al.
Pubblicazione: (2024)
di: Li, Shuyue Stella, et al.
Pubblicazione: (2024)
ParaPO: Aligning Language Models to Reduce Verbatim Reproduction of Pre-training Data
di: Chen, Tong, et al.
Pubblicazione: (2025)
di: Chen, Tong, et al.
Pubblicazione: (2025)
PrefDisco: Benchmarking Proactive Personalized Reasoning
di: Li, Shuyue Stella, et al.
Pubblicazione: (2025)
di: Li, Shuyue Stella, et al.
Pubblicazione: (2025)
Reconstruction Alignment Improves Unified Multimodal Models
di: Xie, Ji, et al.
Pubblicazione: (2025)
di: Xie, Ji, et al.
Pubblicazione: (2025)
TV2TV: A Unified Framework for Interleaved Language and Video Generation
di: Han, Xiaochuang, et al.
Pubblicazione: (2025)
di: Han, Xiaochuang, et al.
Pubblicazione: (2025)
EvoLM: Self-Evolving Language Models through Co-Evolved Discriminative Rubrics
di: Li, Shuyue Stella, et al.
Pubblicazione: (2026)
di: Li, Shuyue Stella, et al.
Pubblicazione: (2026)
CopyBench: Measuring Literal and Non-Literal Reproduction of Copyright-Protected Text in Language Model Generation
di: Chen, Tong, et al.
Pubblicazione: (2024)
di: Chen, Tong, et al.
Pubblicazione: (2024)
BLaVe-CoT: Consistency-Aware Visual Question Answering for Blind and Low Vision Users
di: Cheng, Wanyin, et al.
Pubblicazione: (2025)
di: Cheng, Wanyin, et al.
Pubblicazione: (2025)
Cold-Start Personalization via Training-Free Priors from Structured World Models
di: Bose, Avinandan, et al.
Pubblicazione: (2026)
di: Bose, Avinandan, et al.
Pubblicazione: (2026)
V-Zero: Self-Improving Multimodal Reasoning with Zero Annotation
di: Wang, Han, et al.
Pubblicazione: (2026)
di: Wang, Han, et al.
Pubblicazione: (2026)
Visual Sketchpad: Sketching as a Visual Chain of Thought for Multimodal Language Models
di: Hu, Yushi, et al.
Pubblicazione: (2024)
di: Hu, Yushi, et al.
Pubblicazione: (2024)
Improving MoE Compute Efficiency by Composing Weight and Data Sparsity
di: Kilian, Maciej, et al.
Pubblicazione: (2026)
di: Kilian, Maciej, et al.
Pubblicazione: (2026)
Computational Tradeoffs in Image Synthesis: Diffusion, Masked-Token, and Next-Token Prediction
di: Kilian, Maciej, et al.
Pubblicazione: (2024)
di: Kilian, Maciej, et al.
Pubblicazione: (2024)
Comparing Hallucination Detection Metrics for Multilingual Generation
di: Kang, Haoqiang, et al.
Pubblicazione: (2024)
di: Kang, Haoqiang, et al.
Pubblicazione: (2024)
(Mis)Fitting: A Survey of Scaling Laws
di: Li, Margaret, et al.
Pubblicazione: (2025)
di: Li, Margaret, et al.
Pubblicazione: (2025)
A False Sense of Privacy: Evaluating Textual Data Sanitization Beyond Surface-level Privacy Leakage
di: Xin, Rui, et al.
Pubblicazione: (2025)
di: Xin, Rui, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Multimodal RewardBench: Holistic Evaluation of Reward Models for Vision Language Models
di: Yasunaga, Michihiro, et al.
Pubblicazione: (2025) -
GenEval 2: Addressing Benchmark Drift in Text-to-Image Evaluation
di: Kamath, Amita, et al.
Pubblicazione: (2025) -
Multimodal RewardBench 2: Evaluating Omni Reward Models for Interleaved Text and Image
di: Hu, Yushi, et al.
Pubblicazione: (2025) -
Facilitating Self-Guided Mental Health Interventions Through Human-Language Model Interaction: A Case Study of Cognitive Restructuring
di: Sharma, Ashish, et al.
Pubblicazione: (2023) -
ALMA: Alignment with Minimal Annotation
di: Yasunaga, Michihiro, et al.
Pubblicazione: (2024)