DEE: Dual-stage Explainable Evaluation Method for Text Generation
Fuente:
arXiv
Guardado en:
| Autores principales: | Zhang, Shenyu, Li, Yu, Wu, Rui, Huang, Xiutian, Chen, Yongrui, Xu, Wenhao, Qi, Guilin |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
MATEval: A Multi-Agent Discussion Framework for Advancing Open-Ended Text Evaluation
por: Li, Yu, et al.
Publicado: (2024)
por: Li, Yu, et al.
Publicado: (2024)
StressEval: Failure-Driven Dynamic Benchmarking for Knowledge-Intensive Reasoning in Large Language Models
por: Chen, Yongrui, et al.
Publicado: (2026)
por: Chen, Yongrui, et al.
Publicado: (2026)
K-DeCore: Facilitating Knowledge Transfer in Continual Structured Knowledge Reasoning via Knowledge Decoupling
por: Chen, Yongrui, et al.
Publicado: (2025)
por: Chen, Yongrui, et al.
Publicado: (2025)
Magic Mushroom: A Customizable Benchmark for Fine-grained Analysis of Retrieval Noise Erosion in RAG Systems
por: Zhang, Yuxin, et al.
Publicado: (2025)
por: Zhang, Yuxin, et al.
Publicado: (2025)
DoG-Instruct: Towards Premium Instruction-Tuning Data via Text-Grounded Instruction Wrapping
por: Chen, Yongrui, et al.
Publicado: (2023)
por: Chen, Yongrui, et al.
Publicado: (2023)
Exploring the Impact of Table-to-Text Methods on Augmenting LLM-based Question Answering with Domain Hybrid Data
por: Min, Dehai, et al.
Publicado: (2024)
por: Min, Dehai, et al.
Publicado: (2024)
Pandora: Leveraging Code-driven Knowledge Transfer for Unified Structured Knowledge Reasoning
por: Chen, Yongrui, et al.
Publicado: (2025)
por: Chen, Yongrui, et al.
Publicado: (2025)
Pandora: A Code-Driven Large Language Model Agent for Unified Reasoning Across Diverse Structured Knowledge
por: Chen, Yongrui, et al.
Publicado: (2025)
por: Chen, Yongrui, et al.
Publicado: (2025)
Can LLMs Evaluate Complex Attribution in QA? Automatic Benchmarking using Knowledge Graphs
por: Hu, Nan, et al.
Publicado: (2024)
por: Hu, Nan, et al.
Publicado: (2024)
C$^3$TG: Conflict-aware, Composite, and Collaborative Controlled Text Generation
por: Li, Yu, et al.
Publicado: (2025)
por: Li, Yu, et al.
Publicado: (2025)
TIGERScore: Towards Building Explainable Metric for All Text Generation Tasks
por: Jiang, Dongfu, et al.
Publicado: (2023)
por: Jiang, Dongfu, et al.
Publicado: (2023)
After Retrieval, Before Generation: Enhancing the Trustworthiness of Large Language Models in Retrieval-Augmented Generation
por: Dai, Xinbang, et al.
Publicado: (2025)
por: Dai, Xinbang, et al.
Publicado: (2025)
Table-r1: Self-supervised and Reinforcement Learning for Program-based Table Reasoning in Small Language Models
por: Jin, Rihui, et al.
Publicado: (2025)
por: Jin, Rihui, et al.
Publicado: (2025)
AgentBank: Towards Generalized LLM Agents via Fine-Tuning on 50000+ Interaction Trajectories
por: Song, Yifan, et al.
Publicado: (2024)
por: Song, Yifan, et al.
Publicado: (2024)
ORCHID: A Chinese Debate Corpus for Target-Independent Stance Detection and Argumentative Dialogue Summarization
por: Zhao, Xiutian, et al.
Publicado: (2024)
por: Zhao, Xiutian, et al.
Publicado: (2024)
Measuring the Inconsistency of Large Language Models in Preferential Ranking
por: Zhao, Xiutian, et al.
Publicado: (2024)
por: Zhao, Xiutian, et al.
Publicado: (2024)
An Electoral Approach to Diversify LLM-based Multi-Agent Collective Decision-Making
por: Zhao, Xiutian, et al.
Publicado: (2024)
por: Zhao, Xiutian, et al.
Publicado: (2024)
Question Answering Over Spatio-Temporal Knowledge Graph
por: Dai, Xinbang, et al.
Publicado: (2024)
por: Dai, Xinbang, et al.
Publicado: (2024)
A Survey of Automatic Evaluation Methods on Text, Visual and Speech Generations
por: Lan, Tian, et al.
Publicado: (2025)
por: Lan, Tian, et al.
Publicado: (2025)
MIKE: A New Benchmark for Fine-grained Multimodal Entity Knowledge Editing
por: Li, Jiaqi, et al.
Publicado: (2024)
por: Li, Jiaqi, et al.
Publicado: (2024)
SyntaxShap: Syntax-aware Explainability Method for Text Generation
por: Amara, Kenza, et al.
Publicado: (2024)
por: Amara, Kenza, et al.
Publicado: (2024)
LM$^2$otifs : An Explainable Framework for Machine-Generated Texts Detection
por: Zheng, Xu, et al.
Publicado: (2025)
por: Zheng, Xu, et al.
Publicado: (2025)
SPOR: A Comprehensive and Practical Evaluation Method for Compositional Generalization in Data-to-Text Generation
por: Xu, Ziyao, et al.
Publicado: (2024)
por: Xu, Ziyao, et al.
Publicado: (2024)
HeGTa: Leveraging Heterogeneous Graph-enhanced Large Language Models for Few-shot Complex Table Understanding
por: Jin, Rihui, et al.
Publicado: (2024)
por: Jin, Rihui, et al.
Publicado: (2024)
StyleDecipher: Robust and Explainable Detection of LLM-Generated Texts with Stylistic Analysis
por: Li, Siyuan, et al.
Publicado: (2025)
por: Li, Siyuan, et al.
Publicado: (2025)
PRIMO: Progressive Induction for Multi-hop Open Rule Generation
por: Liu, Jianyu, et al.
Publicado: (2024)
por: Liu, Jianyu, et al.
Publicado: (2024)
Embedding Ontologies via Incorporating Extensional and Intensional Knowledge
por: Wang, Keyu, et al.
Publicado: (2024)
por: Wang, Keyu, et al.
Publicado: (2024)
OneEval: Benchmarking LLM Knowledge-intensive Reasoning over Diverse Knowledge Bases
por: Chen, Yongrui, et al.
Publicado: (2025)
por: Chen, Yongrui, et al.
Publicado: (2025)
Discovering and Causally Validating Emotion-Sensitive Neurons in Large Audio-Language Models
por: Zhao, Xiutian, et al.
Publicado: (2026)
por: Zhao, Xiutian, et al.
Publicado: (2026)
Detecting Machine-Generated Texts: Not Just "AI vs Humans" and Explainability is Complicated
por: Ji, Jiazhou, et al.
Publicado: (2024)
por: Ji, Jiazhou, et al.
Publicado: (2024)
Decision-Oriented Text Evaluation
por: Huang, Yu-Shiang, et al.
Publicado: (2025)
por: Huang, Yu-Shiang, et al.
Publicado: (2025)
Challenges and Opportunities in Text Generation Explainability
por: Amara, Kenza, et al.
Publicado: (2024)
por: Amara, Kenza, et al.
Publicado: (2024)
Watch Every Step! LLM Agent Learning via Iterative Step-Level Process Refinement
por: Xiong, Weimin, et al.
Publicado: (2024)
por: Xiong, Weimin, et al.
Publicado: (2024)
UniHGKR: Unified Instruction-aware Heterogeneous Knowledge Retrievers
por: Min, Dehai, et al.
Publicado: (2024)
por: Min, Dehai, et al.
Publicado: (2024)
SQLStructEval: Structural Evaluation of LLM Text-to-SQL Generation
por: Zhou, Yixi, et al.
Publicado: (2026)
por: Zhou, Yixi, et al.
Publicado: (2026)
Neuron-Level Emotion Control in Speech-Generative Large Audio-Language Models
por: Zhao, Xiutian, et al.
Publicado: (2026)
por: Zhao, Xiutian, et al.
Publicado: (2026)
CoTKR: Chain-of-Thought Enhanced Knowledge Rewriting for Complex Knowledge Graph Question Answering
por: Wu, Yike, et al.
Publicado: (2024)
por: Wu, Yike, et al.
Publicado: (2024)
Holistic Evaluation for Interleaved Text-and-Image Generation
por: Liu, Minqian, et al.
Publicado: (2024)
por: Liu, Minqian, et al.
Publicado: (2024)
EMMM, Explain Me My Model! Explainable Machine Generated Text Detection in Dialogues
por: Yuan, Angela Yifei, et al.
Publicado: (2025)
por: Yuan, Angela Yifei, et al.
Publicado: (2025)
ExPerT: Effective and Explainable Evaluation of Personalized Long-Form Text Generation
por: Salemi, Alireza, et al.
Publicado: (2025)
por: Salemi, Alireza, et al.
Publicado: (2025)
Ejemplares similares
-
MATEval: A Multi-Agent Discussion Framework for Advancing Open-Ended Text Evaluation
por: Li, Yu, et al.
Publicado: (2024) -
StressEval: Failure-Driven Dynamic Benchmarking for Knowledge-Intensive Reasoning in Large Language Models
por: Chen, Yongrui, et al.
Publicado: (2026) -
K-DeCore: Facilitating Knowledge Transfer in Continual Structured Knowledge Reasoning via Knowledge Decoupling
por: Chen, Yongrui, et al.
Publicado: (2025) -
Magic Mushroom: A Customizable Benchmark for Fine-grained Analysis of Retrieval Noise Erosion in RAG Systems
por: Zhang, Yuxin, et al.
Publicado: (2025) -
DoG-Instruct: Towards Premium Instruction-Tuning Data via Text-Grounded Instruction Wrapping
por: Chen, Yongrui, et al.
Publicado: (2023)