X-Eval: Generalizable Multi-aspect Text Evaluation via Augmented Instruction Tuning with Auxiliary Evaluation Aspects
Fuente:
arXiv
Saved in:
| Main Authors: | Liu, Minqian, Shen, Ying, Xu, Zhiyang, Cao, Yixin, Cho, Eunah, Kumar, Vaibhav, Ghanadan, Reza, Huang, Lifu |
|---|---|
| Format: | Preprint |
| Published: |
2023
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Holistic Evaluation for Interleaved Text-and-Image Generation
by: Liu, Minqian, et al.
Published: (2024)
by: Liu, Minqian, et al.
Published: (2024)
MULTISCRIPT: Multimodal Script Learning for Supporting Open Domain Everyday Tasks
by: Qi, Jingyuan, et al.
Published: (2023)
by: Qi, Jingyuan, et al.
Published: (2023)
EffiEval: Efficient and Generalizable Model Evaluation via Capability Coverage Maximization
by: Wang, Yaoning, et al.
Published: (2025)
by: Wang, Yaoning, et al.
Published: (2025)
Multimodal Instruction Tuning with Conditional Mixture of LoRA
by: Shen, Ying, et al.
Published: (2024)
by: Shen, Ying, et al.
Published: (2024)
Navigating Ideation Space: Decomposed Conceptual Representations for Positioning Scientific Ideas
by: Shen, Yuexi, et al.
Published: (2026)
by: Shen, Yuexi, et al.
Published: (2026)
Modality-Specialized Synergizers for Interleaved Vision-Language Generalists
by: Xu, Zhiyang, et al.
Published: (2024)
by: Xu, Zhiyang, et al.
Published: (2024)
Vision-Flan: Scaling Human-Labeled Tasks in Visual Instruction Tuning
by: Xu, Zhiyang, et al.
Published: (2024)
by: Xu, Zhiyang, et al.
Published: (2024)
AR-RAG: Autoregressive Retrieval Augmentation for Image Generation
by: Qi, Jingyuan, et al.
Published: (2025)
by: Qi, Jingyuan, et al.
Published: (2025)
FRABench and UFEval: Unified Fine-grained Evaluation with Task and Aspect Generalization
by: Hong, Shibo, et al.
Published: (2025)
by: Hong, Shibo, et al.
Published: (2025)
RepEval: Effective Text Evaluation with LLM Representation
by: Sheng, Shuqian, et al.
Published: (2024)
by: Sheng, Shuqian, et al.
Published: (2024)
SPARTUN3D: Situated Spatial Understanding of 3D World in Large Language Models
by: Zhang, Yue, et al.
Published: (2024)
by: Zhang, Yue, et al.
Published: (2024)
UniHGKR: Unified Instruction-aware Heterogeneous Knowledge Retrievers
by: Min, Dehai, et al.
Published: (2024)
by: Min, Dehai, et al.
Published: (2024)
AMELI: Enhancing Multimodal Entity Linking with Fine-Grained Attributes
by: Yao, Barry Menglong, et al.
Published: (2023)
by: Yao, Barry Menglong, et al.
Published: (2023)
EP23.14: Diagnostic accuracy of adnexal malignancy assessment models ADNEX and simple rules when applied by individuals with no prior clinical experience
by: G. Ghanadan
Published: (2024)
by: G. Ghanadan
Published: (2024)
EP23.37: Ultrasonography experience may not be a reliable indicator for improved accuracy in assessing malignancy in adnexal tumours using the ADNEX model
by: G. Ghanadan
Published: (2024)
by: G. Ghanadan
Published: (2024)
R2I-Bench: Benchmarking Reasoning-Driven Text-to-Image Generation
by: Chen, Kaijie, et al.
Published: (2025)
by: Chen, Kaijie, et al.
Published: (2025)
LLM Braces: Straightening Out LLM Predictions with Relevant Sub-Updates
by: Shen, Ying, et al.
Published: (2025)
by: Shen, Ying, et al.
Published: (2025)
VLEU: a Method for Automatic Evaluation for Generalizability of Text-to-Image Models
by: Cao, Jingtao, et al.
Published: (2024)
by: Cao, Jingtao, et al.
Published: (2024)
On the Evaluation and Refinement of Vision-Language Instruction Tuning Datasets
by: Liao, Ning, et al.
Published: (2023)
by: Liao, Ning, et al.
Published: (2023)
BatchEval: Towards Human-like Text Evaluation
by: Yuan, Peiwen, et al.
Published: (2023)
by: Yuan, Peiwen, et al.
Published: (2023)
ConStyX: Content Style Augmentation for Generalizable Medical Image Segmentation
by: Chen, Xi, et al.
Published: (2025)
by: Chen, Xi, et al.
Published: (2025)
SuperFlow: Training Flow Matching Models with RL on the Fly
by: Chen, Kaijie, et al.
Published: (2025)
by: Chen, Kaijie, et al.
Published: (2025)
BotEval: Facilitating Interactive Human Evaluation
by: Cho, Hyundong, et al.
Published: (2024)
by: Cho, Hyundong, et al.
Published: (2024)
JsonTuning: Towards Generalizable, Robust, and Controllable Instruction Tuning
by: Gao, Chang, et al.
Published: (2023)
by: Gao, Chang, et al.
Published: (2023)
LLM Can be a Dangerous Persuader: Empirical Study of Persuasion Safety in Large Language Models
by: Liu, Minqian, et al.
Published: (2025)
by: Liu, Minqian, et al.
Published: (2025)
AudioEval: Automatic Dual-Perspective and Multi-Dimensional Evaluation of Text-to-Audio-Generation
by: Wang, Hui, et al.
Published: (2025)
by: Wang, Hui, et al.
Published: (2025)
Multi-Aspect Controllable Text Generation with Disentangled Counterfactual Augmentation
by: Liu, Yi, et al.
Published: (2024)
by: Liu, Yi, et al.
Published: (2024)
Toward Generalizable Evaluation in the LLM Era: A Survey Beyond Benchmarks
by: Cao, Yixin, et al.
Published: (2025)
by: Cao, Yixin, et al.
Published: (2025)
MSRS: Evaluating Multi-Source Retrieval-Augmented Generation
by: Phanse, Rohan, et al.
Published: (2025)
by: Phanse, Rohan, et al.
Published: (2025)
SQLStructEval: Structural Evaluation of LLM Text-to-SQL Generation
by: Zhou, Yixi, et al.
Published: (2026)
by: Zhou, Yixi, et al.
Published: (2026)
MTQ-Eval: Multilingual Text Quality Evaluation for Language Models
by: Pokharel, Rhitabrat, et al.
Published: (2025)
by: Pokharel, Rhitabrat, et al.
Published: (2025)
DynamicEval: Rethinking Evaluation for Dynamic Text-to-Video Synthesis
by: Babu, Nithin C., et al.
Published: (2025)
by: Babu, Nithin C., et al.
Published: (2025)
DocLens: Multi-aspect Fine-grained Evaluation for Medical Text Generation
by: Xie, Yiqing, et al.
Published: (2023)
by: Xie, Yiqing, et al.
Published: (2023)
Teach2Eval: An Indirect Evaluation Method for LLM by Judging How It Teaches
by: Zhou, Yuhang, et al.
Published: (2025)
by: Zhou, Yuhang, et al.
Published: (2025)
NormEval: A Unified Multi-Metric Framework for Evaluating Semantic Fidelity in Text Normalization
by: Kafi, Md Abdullah Al, et al.
Published: (2025)
by: Kafi, Md Abdullah Al, et al.
Published: (2025)
LexInstructEval: Lexical Instruction Following Evaluation for Large Language Models
by: Ren, Huimin, et al.
Published: (2025)
by: Ren, Huimin, et al.
Published: (2025)
PatentMind: A Multi-Aspect Reasoning Graph for Patent Similarity Evaluation
by: Yoo, Yongmin, et al.
Published: (2025)
by: Yoo, Yongmin, et al.
Published: (2025)
ZSC-Eval: An Evaluation Toolkit and Benchmark for Multi-agent Zero-shot Coordination
by: Wang, Xihuai, et al.
Published: (2023)
by: Wang, Xihuai, et al.
Published: (2023)
StagePilot: A Deep Reinforcement Learning Agent for Stage-Controlled Cybergrooming Simulation
by: An, Heajun, et al.
Published: (2026)
by: An, Heajun, et al.
Published: (2026)
SynthTextEval: Synthetic Text Data Generation and Evaluation for High-Stakes Domains
by: Ramesh, Krithika, et al.
Published: (2025)
by: Ramesh, Krithika, et al.
Published: (2025)
Similar Items
-
Holistic Evaluation for Interleaved Text-and-Image Generation
by: Liu, Minqian, et al.
Published: (2024) -
MULTISCRIPT: Multimodal Script Learning for Supporting Open Domain Everyday Tasks
by: Qi, Jingyuan, et al.
Published: (2023) -
EffiEval: Efficient and Generalizable Model Evaluation via Capability Coverage Maximization
by: Wang, Yaoning, et al.
Published: (2025) -
Multimodal Instruction Tuning with Conditional Mixture of LoRA
by: Shen, Ying, et al.
Published: (2024) -
Navigating Ideation Space: Decomposed Conceptual Representations for Positioning Scientific Ideas
by: Shen, Yuexi, et al.
Published: (2026)