Quality Estimation with $k$-nearest Neighbors and Automatic Evaluation for Model-specific Quality Estimation
Fuente:
arXiv
Salvato in:
| Autori principali: | Dinh, Tu Anh, Palzer, Tobias, Niehues, Jan |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Are Generative Models Underconfident? Better Quality Estimation with Boosted Model Probability
di: Dinh, Tu Anh, et al.
Pubblicazione: (2025)
di: Dinh, Tu Anh, et al.
Pubblicazione: (2025)
Sigmoid Head for Quality Estimation under Language Ambiguity
di: Dinh, Tu Anh, et al.
Pubblicazione: (2026)
di: Dinh, Tu Anh, et al.
Pubblicazione: (2026)
Knockout LLM Assessment: Using Large Language Models for Evaluations through Iterative Pairwise Comparisons
di: Sandan, Isik Baran, et al.
Pubblicazione: (2025)
di: Sandan, Isik Baran, et al.
Pubblicazione: (2025)
COMET-poly: Machine Translation Metric Grounded in Other Candidates
di: Züfle, Maike, et al.
Pubblicazione: (2025)
di: Züfle, Maike, et al.
Pubblicazione: (2025)
SciEx: Benchmarking Large Language Models on Scientific Exams with Human Expert Grading and Automatic Grading
di: Dinh, Tu Anh, et al.
Pubblicazione: (2024)
di: Dinh, Tu Anh, et al.
Pubblicazione: (2024)
BOUQuET: dataset, Benchmark and Open initiative for Universal Quality Evaluation in Translation
di: The Omnilingual MT Team, et al.
Pubblicazione: (2025)
di: The Omnilingual MT Team, et al.
Pubblicazione: (2025)
Is Less More? Quality, Quantity and Context in Idiom Processing with Natural Language Models
di: Knietaite, Agne, et al.
Pubblicazione: (2024)
di: Knietaite, Agne, et al.
Pubblicazione: (2024)
Comprehensiveness Metrics for Automatic Evaluation of Factual Recall in Text Generation
di: Dejl, Adam, et al.
Pubblicazione: (2025)
di: Dejl, Adam, et al.
Pubblicazione: (2025)
Cross-lingual Human-Preference Alignment for Neural Machine Translation with Direct Quality Optimization
di: Uhlig, Kaden, et al.
Pubblicazione: (2024)
di: Uhlig, Kaden, et al.
Pubblicazione: (2024)
Encoder-Decoder Framework for Interactive Free Verses with Generation with Controllable High-Quality Rhyming
di: Pasini, Tommaso, et al.
Pubblicazione: (2024)
di: Pasini, Tommaso, et al.
Pubblicazione: (2024)
Tokenization and Morphology in Multilingual Language Models: A Comparative Analysis of mT5 and ByT5
di: Dang, Thao Anh, et al.
Pubblicazione: (2024)
di: Dang, Thao Anh, et al.
Pubblicazione: (2024)
CRISP: Persistent Concept Unlearning via Sparse Autoencoders
di: Ashuach, Tomer, et al.
Pubblicazione: (2025)
di: Ashuach, Tomer, et al.
Pubblicazione: (2025)
Calibrated Confidence Estimation for Tabular Question Answering
di: Voss, Lukas
Pubblicazione: (2026)
di: Voss, Lukas
Pubblicazione: (2026)
The Paradox of Poetic Intent in Back-Translation: Evaluating the Quality of Large Language Models in Chinese Translation
di: Weigang, Li, et al.
Pubblicazione: (2025)
di: Weigang, Li, et al.
Pubblicazione: (2025)
ADAG: Automatically Describing Attribution Graphs
di: Arora, Aryaman, et al.
Pubblicazione: (2026)
di: Arora, Aryaman, et al.
Pubblicazione: (2026)
Identifying Fairness Issues in Automatically Generated Testing Content
di: Stowe, Kevin, et al.
Pubblicazione: (2024)
di: Stowe, Kevin, et al.
Pubblicazione: (2024)
Automatic Task Detection and Heterogeneous LLM Speculative Decoding
di: Ge, Danying, et al.
Pubblicazione: (2025)
di: Ge, Danying, et al.
Pubblicazione: (2025)
LombardoGraphia: Automatic Classification of Lombard Orthography Variants
di: Signoroni, Edoardo, et al.
Pubblicazione: (2026)
di: Signoroni, Edoardo, et al.
Pubblicazione: (2026)
Synthetic Voice Data for Automatic Speech Recognition in African Languages
di: DeRenzi, Brian, et al.
Pubblicazione: (2025)
di: DeRenzi, Brian, et al.
Pubblicazione: (2025)
Text-Based Approaches to Item Difficulty Modeling in Large-Scale Assessments: A Systematic Review
di: Peters, Sydney, et al.
Pubblicazione: (2025)
di: Peters, Sydney, et al.
Pubblicazione: (2025)
SEED: Enhancing Text-to-SQL Performance and Practical Usability Through Automatic Evidence Generation
di: Yun, Janghyeon, et al.
Pubblicazione: (2025)
di: Yun, Janghyeon, et al.
Pubblicazione: (2025)
The GDN-CC Dataset: Automatic Corpus Clarification for AI-enhanced Democratic Citizen Consultations
di: Lequeu, Pierre-Antoine, et al.
Pubblicazione: (2026)
di: Lequeu, Pierre-Antoine, et al.
Pubblicazione: (2026)
Evaluating the Efficacy of Hybrid Deep Learning Models in Distinguishing AI-Generated Text
di: Oketunji, Abiodun Finbarrs
Pubblicazione: (2023)
di: Oketunji, Abiodun Finbarrs
Pubblicazione: (2023)
Towards Fundamental Language Models: Does Linguistic Competence Scale with Model Size?
di: Collado-Montañez, Jaime, et al.
Pubblicazione: (2025)
di: Collado-Montañez, Jaime, et al.
Pubblicazione: (2025)
LLMs and Memorization: On Quality and Specificity of Copyright Compliance
di: Mueller, Felix B, et al.
Pubblicazione: (2024)
di: Mueller, Felix B, et al.
Pubblicazione: (2024)
Breaking the HISCO Barrier: Automatic Occupational Standardization with OccCANINE
di: Dahl, Christian Møller, et al.
Pubblicazione: (2024)
di: Dahl, Christian Møller, et al.
Pubblicazione: (2024)
Towards Human Understanding of Paraphrase Types in Large Language Models
di: Meier, Dominik, et al.
Pubblicazione: (2024)
di: Meier, Dominik, et al.
Pubblicazione: (2024)
German Text Simplification: Finetuning Large Language Models with Semi-Synthetic Data
di: Klöser, Lars, et al.
Pubblicazione: (2024)
di: Klöser, Lars, et al.
Pubblicazione: (2024)
OPOR-Bench: Evaluating Large Language Models on Online Public Opinion Report Generation
di: Yu, Jinzheng, et al.
Pubblicazione: (2025)
di: Yu, Jinzheng, et al.
Pubblicazione: (2025)
Big City Bias: Evaluating the Impact of Metropolitan Size on Computational Job Market Abilities of Language Models
di: Campanella, Charlie, et al.
Pubblicazione: (2024)
di: Campanella, Charlie, et al.
Pubblicazione: (2024)
GroUSE: A Benchmark to Evaluate Evaluators in Grounded Question Answering
di: Muller, Sacha, et al.
Pubblicazione: (2024)
di: Muller, Sacha, et al.
Pubblicazione: (2024)
Evaluating Large Language Models for Zero-Shot Disease Labeling in CT Radiology Reports Across Organ Systems
di: Garcia-Alcoser, Michael E., et al.
Pubblicazione: (2025)
di: Garcia-Alcoser, Michael E., et al.
Pubblicazione: (2025)
RomanLens: The Role Of Latent Romanization In Multilinguality In LLMs
di: Saji, Alan, et al.
Pubblicazione: (2025)
di: Saji, Alan, et al.
Pubblicazione: (2025)
Automatic Generation of Conversational Interfaces for Tabular Data Analysis
di: Gomez-Vazquez, Marcos, et al.
Pubblicazione: (2023)
di: Gomez-Vazquez, Marcos, et al.
Pubblicazione: (2023)
LLMs Are Not Scorers: Rethinking MT Evaluation with Generation-Based Methods
di: Cui, Hyang
Pubblicazione: (2025)
di: Cui, Hyang
Pubblicazione: (2025)
VLEU: a Method for Automatic Evaluation for Generalizability of Text-to-Image Models
di: Cao, Jingtao, et al.
Pubblicazione: (2024)
di: Cao, Jingtao, et al.
Pubblicazione: (2024)
Align and Shine: Building High-Quality Sentence-Aligned Corpora for Multilingual Text Simplification
di: Hilasaca, Kenji, et al.
Pubblicazione: (2026)
di: Hilasaca, Kenji, et al.
Pubblicazione: (2026)
Sensitive Content Classification in Social Media: A Holistic Resource and Evaluation
di: Antypas, Dimosthenis, et al.
Pubblicazione: (2024)
di: Antypas, Dimosthenis, et al.
Pubblicazione: (2024)
ManagerBench: Evaluating the Safety-Pragmatism Trade-off in Autonomous LLMs
di: Simhi, Adi, et al.
Pubblicazione: (2025)
di: Simhi, Adi, et al.
Pubblicazione: (2025)
LLM-GLOBE: A Benchmark Evaluating the Cultural Values Embedded in LLM Output
di: Karinshak, Elise, et al.
Pubblicazione: (2024)
di: Karinshak, Elise, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Are Generative Models Underconfident? Better Quality Estimation with Boosted Model Probability
di: Dinh, Tu Anh, et al.
Pubblicazione: (2025) -
Sigmoid Head for Quality Estimation under Language Ambiguity
di: Dinh, Tu Anh, et al.
Pubblicazione: (2026) -
Knockout LLM Assessment: Using Large Language Models for Evaluations through Iterative Pairwise Comparisons
di: Sandan, Isik Baran, et al.
Pubblicazione: (2025) -
COMET-poly: Machine Translation Metric Grounded in Other Candidates
di: Züfle, Maike, et al.
Pubblicazione: (2025) -
SciEx: Benchmarking Large Language Models on Scientific Exams with Human Expert Grading and Automatic Grading
di: Dinh, Tu Anh, et al.
Pubblicazione: (2024)