Self-Improving VLM Judges Without Human Annotations
Fuente:
arXiv
Guardado en:
| Autores principales: | Lin, Inna Wanyin, Hu, Yushi, Li, Shuyue Stella, Geng, Scott, Koh, Pang Wei, Zettlemoyer, Luke, Althoff, Tim, Ghazvininejad, Marjan |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Multimodal RewardBench: Holistic Evaluation of Reward Models for Vision Language Models
por: Yasunaga, Michihiro, et al.
Publicado: (2025)
por: Yasunaga, Michihiro, et al.
Publicado: (2025)
GenEval 2: Addressing Benchmark Drift in Text-to-Image Evaluation
por: Kamath, Amita, et al.
Publicado: (2025)
por: Kamath, Amita, et al.
Publicado: (2025)
Multimodal RewardBench 2: Evaluating Omni Reward Models for Interleaved Text and Image
por: Hu, Yushi, et al.
Publicado: (2025)
por: Hu, Yushi, et al.
Publicado: (2025)
Facilitating Self-Guided Mental Health Interventions Through Human-Language Model Interaction: A Case Study of Cognitive Restructuring
por: Sharma, Ashish, et al.
Publicado: (2023)
por: Sharma, Ashish, et al.
Publicado: (2023)
ALMA: Alignment with Minimal Annotation
por: Yasunaga, Michihiro, et al.
Publicado: (2024)
por: Yasunaga, Michihiro, et al.
Publicado: (2024)
IMBUE: Improving Interpersonal Effectiveness through Simulation and Just-in-time Feedback with Human-Language Model Interaction
por: Lin, Inna Wanyin, et al.
Publicado: (2024)
por: Lin, Inna Wanyin, et al.
Publicado: (2024)
JPEG-LM: LLMs as Image Generators with Canonical Codec Representations
por: Han, Xiaochuang, et al.
Publicado: (2024)
por: Han, Xiaochuang, et al.
Publicado: (2024)
A Computational Framework for Behavioral Assessment of LLM Therapists
por: Chiu, Yu Ying, et al.
Publicado: (2024)
por: Chiu, Yu Ying, et al.
Publicado: (2024)
Learning to Plan & Reason for Evaluation with Thinking-LLM-as-a-Judge
por: Saha, Swarnadeep, et al.
Publicado: (2025)
por: Saha, Swarnadeep, et al.
Publicado: (2025)
Unified Text-Image Generation with Weakness-Targeted Post-Training
por: Chen, Jiahui, et al.
Publicado: (2026)
por: Chen, Jiahui, et al.
Publicado: (2026)
CandorMD: An AI-Assisted Audio Simulation and Feedback System for Training Clinicians for Medical Error Disclosure
por: Lin, Inna Wanyin, et al.
Publicado: (2026)
por: Lin, Inna Wanyin, et al.
Publicado: (2026)
Representation Deficiency in Masked Language Modeling
por: Meng, Yu, et al.
Publicado: (2023)
por: Meng, Yu, et al.
Publicado: (2023)
A Visually Impaired Assistance Benchmark for VLM-as-a-Judge Evaluation
por: Zhao, Yi, et al.
Publicado: (2026)
por: Zhao, Yi, et al.
Publicado: (2026)
Precise Information Control in Long-Form Text Generation
por: He, Jacqueline, et al.
Publicado: (2025)
por: He, Jacqueline, et al.
Publicado: (2025)
RISE: Enhancing VLM Image Annotation with Self-Supervised Reasoning
por: Hu, Suhang, et al.
Publicado: (2025)
por: Hu, Suhang, et al.
Publicado: (2025)
Spurious Rewards: Rethinking Training Signals in RLVR
por: Shao, Rulin, et al.
Publicado: (2025)
por: Shao, Rulin, et al.
Publicado: (2025)
AutoJudge: Judge Decoding Without Manual Annotation
por: Garipov, Roman, et al.
Publicado: (2025)
por: Garipov, Roman, et al.
Publicado: (2025)
David helps Goliath: Inference-Time Collaboration Between Small Specialized and Large General Diffusion LMs
por: Han, Xiaochuang, et al.
Publicado: (2023)
por: Han, Xiaochuang, et al.
Publicado: (2023)
reWordBench: Benchmarking and Improving the Robustness of Reward Models with Transformed Inputs
por: Wu, Zhaofeng, et al.
Publicado: (2025)
por: Wu, Zhaofeng, et al.
Publicado: (2025)
Scaling Retrieval-Based Language Models with a Trillion-Token Datastore
por: Shao, Rulin, et al.
Publicado: (2024)
por: Shao, Rulin, et al.
Publicado: (2024)
Anchored Decoding: Provably Reducing Copyright Risk for Any Language Model
por: He, Jacqueline, et al.
Publicado: (2026)
por: He, Jacqueline, et al.
Publicado: (2026)
Annotation alignment: Comparing LLM and human annotations of conversational safety
por: Movva, Rajiv, et al.
Publicado: (2024)
por: Movva, Rajiv, et al.
Publicado: (2024)
Reliable, Adaptable, and Attributable Language Models with Retrieval
por: Asai, Akari, et al.
Publicado: (2024)
por: Asai, Akari, et al.
Publicado: (2024)
Can External Validation Tools Improve Annotation Quality for LLM-as-a-Judge?
por: Findeis, Arduin, et al.
Publicado: (2025)
por: Findeis, Arduin, et al.
Publicado: (2025)
MediQ: Question-Asking LLMs and a Benchmark for Reliable Interactive Clinical Reasoning
por: Li, Shuyue Stella, et al.
Publicado: (2024)
por: Li, Shuyue Stella, et al.
Publicado: (2024)
ParaPO: Aligning Language Models to Reduce Verbatim Reproduction of Pre-training Data
por: Chen, Tong, et al.
Publicado: (2025)
por: Chen, Tong, et al.
Publicado: (2025)
PrefDisco: Benchmarking Proactive Personalized Reasoning
por: Li, Shuyue Stella, et al.
Publicado: (2025)
por: Li, Shuyue Stella, et al.
Publicado: (2025)
Reconstruction Alignment Improves Unified Multimodal Models
por: Xie, Ji, et al.
Publicado: (2025)
por: Xie, Ji, et al.
Publicado: (2025)
TV2TV: A Unified Framework for Interleaved Language and Video Generation
por: Han, Xiaochuang, et al.
Publicado: (2025)
por: Han, Xiaochuang, et al.
Publicado: (2025)
EvoLM: Self-Evolving Language Models through Co-Evolved Discriminative Rubrics
por: Li, Shuyue Stella, et al.
Publicado: (2026)
por: Li, Shuyue Stella, et al.
Publicado: (2026)
CopyBench: Measuring Literal and Non-Literal Reproduction of Copyright-Protected Text in Language Model Generation
por: Chen, Tong, et al.
Publicado: (2024)
por: Chen, Tong, et al.
Publicado: (2024)
BLaVe-CoT: Consistency-Aware Visual Question Answering for Blind and Low Vision Users
por: Cheng, Wanyin, et al.
Publicado: (2025)
por: Cheng, Wanyin, et al.
Publicado: (2025)
Cold-Start Personalization via Training-Free Priors from Structured World Models
por: Bose, Avinandan, et al.
Publicado: (2026)
por: Bose, Avinandan, et al.
Publicado: (2026)
V-Zero: Self-Improving Multimodal Reasoning with Zero Annotation
por: Wang, Han, et al.
Publicado: (2026)
por: Wang, Han, et al.
Publicado: (2026)
Visual Sketchpad: Sketching as a Visual Chain of Thought for Multimodal Language Models
por: Hu, Yushi, et al.
Publicado: (2024)
por: Hu, Yushi, et al.
Publicado: (2024)
Improving MoE Compute Efficiency by Composing Weight and Data Sparsity
por: Kilian, Maciej, et al.
Publicado: (2026)
por: Kilian, Maciej, et al.
Publicado: (2026)
Computational Tradeoffs in Image Synthesis: Diffusion, Masked-Token, and Next-Token Prediction
por: Kilian, Maciej, et al.
Publicado: (2024)
por: Kilian, Maciej, et al.
Publicado: (2024)
Comparing Hallucination Detection Metrics for Multilingual Generation
por: Kang, Haoqiang, et al.
Publicado: (2024)
por: Kang, Haoqiang, et al.
Publicado: (2024)
(Mis)Fitting: A Survey of Scaling Laws
por: Li, Margaret, et al.
Publicado: (2025)
por: Li, Margaret, et al.
Publicado: (2025)
A False Sense of Privacy: Evaluating Textual Data Sanitization Beyond Surface-level Privacy Leakage
por: Xin, Rui, et al.
Publicado: (2025)
por: Xin, Rui, et al.
Publicado: (2025)
Ejemplares similares
-
Multimodal RewardBench: Holistic Evaluation of Reward Models for Vision Language Models
por: Yasunaga, Michihiro, et al.
Publicado: (2025) -
GenEval 2: Addressing Benchmark Drift in Text-to-Image Evaluation
por: Kamath, Amita, et al.
Publicado: (2025) -
Multimodal RewardBench 2: Evaluating Omni Reward Models for Interleaved Text and Image
por: Hu, Yushi, et al.
Publicado: (2025) -
Facilitating Self-Guided Mental Health Interventions Through Human-Language Model Interaction: A Case Study of Cognitive Restructuring
por: Sharma, Ashish, et al.
Publicado: (2023) -
ALMA: Alignment with Minimal Annotation
por: Yasunaga, Michihiro, et al.
Publicado: (2024)