Enregistré dans:
| Auteurs principaux: | Zhang, Ran, Eger, Steffen |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | https://arxiv.org/abs/2409.03659 |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
LiTransProQA: an LLM-based Literary Translation evaluation metric with Professional Question Answering
par: Zhang, Ran, et autres
Publié: (2025)
par: Zhang, Ran, et autres
Publié: (2025)
PromptOptMe: Error-Aware Prompt Compression for LLM-based MT Evaluation Metrics
par: Larionov, Daniil, et autres
Publié: (2024)
par: Larionov, Daniil, et autres
Publié: (2024)
Do Emotions Really Affect Argument Convincingness? A Dynamic Approach with LLM-based Manipulation Checks
par: Chen, Yanran, et autres
Publié: (2025)
par: Chen, Yanran, et autres
Publié: (2025)
Cross-lingual Cross-temporal Summarization: Dataset, Models, Evaluation
par: Zhang, Ran, et autres
Publié: (2023)
par: Zhang, Ran, et autres
Publié: (2023)
How Good Are LLMs for Literary Translation, Really? Literary Translation Evaluation with Humans and LLMs
par: Zhang, Ran, et autres
Publié: (2024)
par: Zhang, Ran, et autres
Publié: (2024)
PrExMe! Large Scale Prompt Exploration of Open Source LLMs for Machine Translation and Summarization Evaluation
par: Leiter, Christoph, et autres
Publié: (2024)
par: Leiter, Christoph, et autres
Publié: (2024)
ByGPT5: End-to-End Style-conditioned Poetry Generation with Token-free Language Models
par: Belouadi, Jonas, et autres
Publié: (2022)
par: Belouadi, Jonas, et autres
Publié: (2022)
USCORE: An Effective Approach to Fully Unsupervised Evaluation Metrics for Machine Translation
par: Belouadi, Jonas, et autres
Publié: (2022)
par: Belouadi, Jonas, et autres
Publié: (2022)
BatchGEMBA: Token-Efficient Machine Translation Evaluation with Batched Prompting and Prompt Compression
par: Larionov, Daniil, et autres
Publié: (2025)
par: Larionov, Daniil, et autres
Publié: (2025)
Beyond Reproduction: A Paired-Task Framework for Assessing LLM Comprehension and Creativity in Literary Translation
par: Zhang, Ran, et autres
Publié: (2026)
par: Zhang, Ran, et autres
Publié: (2026)
TikZilla: Scaling Text-to-TikZ with High-Quality Data and Reinforcement Learning
par: Greisinger, Christian, et autres
Publié: (2026)
par: Greisinger, Christian, et autres
Publié: (2026)
Is there really a Citation Age Bias in NLP?
par: Nguyen, Hoa, et autres
Publié: (2024)
par: Nguyen, Hoa, et autres
Publié: (2024)
BMX: Boosting Natural Language Generation Metrics with Explainability
par: Leiter, Christoph, et autres
Publié: (2022)
par: Leiter, Christoph, et autres
Publié: (2022)
AutomaTikZ: Text-Guided Synthesis of Scientific Vector Graphics with TikZ
par: Belouadi, Jonas, et autres
Publié: (2023)
par: Belouadi, Jonas, et autres
Publié: (2023)
Graph-Guided Textual Explanation Generation Framework
par: Yuan, Shuzhou, et autres
Publié: (2024)
par: Yuan, Shuzhou, et autres
Publié: (2024)
LLM Analysis of 150+ years of German Parliamentary Debates on Migration Reveals Shift from Post-War Solidarity to Anti-Solidarity in the Last Decade
par: Kostikova, Aida, et autres
Publié: (2025)
par: Kostikova, Aida, et autres
Publié: (2025)
DeTikZify: Synthesizing Graphics Programs for Scientific Figures and Sketches with TikZ
par: Belouadi, Jonas, et autres
Publié: (2024)
par: Belouadi, Jonas, et autres
Publié: (2024)
Evaluating Diversity in Automatic Poetry Generation
par: Chen, Yanran, et autres
Publié: (2024)
par: Chen, Yanran, et autres
Publié: (2024)
Zhyper: Factorized Hypernetworks for Conditioned LLM Fine-Tuning
par: Abdalla, M. H. I., et autres
Publié: (2025)
par: Abdalla, M. H. I., et autres
Publié: (2025)
DeepSeek-R1 vs. o3-mini: How Well can Reasoning LLMs Evaluate MT and Summarization?
par: Larionov, Daniil, et autres
Publié: (2025)
par: Larionov, Daniil, et autres
Publié: (2025)
Evaluating Large Language Models for Structured Science Summarization in the Open Research Knowledge Graph
par: Nechakhin, Vladyslav, et autres
Publié: (2024)
par: Nechakhin, Vladyslav, et autres
Publié: (2024)
Can LLM-Augmented autonomous agents cooperate?, An evaluation of their cooperative capabilities through Melting Pot
par: Mosquera, Manuel, et autres
Publié: (2024)
par: Mosquera, Manuel, et autres
Publié: (2024)
CROC: Evaluating and Training T2I Metrics with Pseudo- and Human-Labeled Contrastive Robustness Checks
par: Leiter, Christoph, et autres
Publié: (2025)
par: Leiter, Christoph, et autres
Publié: (2025)
xCOMET-lite: Bridging the Gap Between Efficiency and Quality in Learned MT Evaluation Metrics
par: Larionov, Daniil, et autres
Publié: (2024)
par: Larionov, Daniil, et autres
Publié: (2024)
Emotionally Charged, Logically Blurred: AI-driven Emotional Framing Impairs Human Fallacy Detection
par: Chen, Yanran, et autres
Publié: (2025)
par: Chen, Yanran, et autres
Publié: (2025)
GerAV: Towards New Heights in German Authorship Verification using Fine-Tuned LLMs on a New Benchmark
par: Kiefer, Lotta, et autres
Publié: (2026)
par: Kiefer, Lotta, et autres
Publié: (2026)
NLLG Quarterly arXiv Report 09/24: What are the most influential current AI Papers?
par: Leiter, Christoph, et autres
Publié: (2024)
par: Leiter, Christoph, et autres
Publié: (2024)
Towards Explainable Evaluation Metrics for Machine Translation
par: Leiter, Christoph, et autres
Publié: (2023)
par: Leiter, Christoph, et autres
Publié: (2023)
Syntactic Language Change in English and German: Metrics, Parsers, and Convergences
par: Chen, Yanran, et autres
Publié: (2024)
par: Chen, Yanran, et autres
Publié: (2024)
Argument Summarization and its Evaluation in the Era of Large Language Models
par: Altemeyer, Moritz, et autres
Publié: (2025)
par: Altemeyer, Moritz, et autres
Publié: (2025)
ValueGround: Evaluating Culture-Conditioned Visual Value Grounding in MLLMs
par: Wang, Zhipin, et autres
Publié: (2026)
par: Wang, Zhipin, et autres
Publié: (2026)
MARS: toward more efficient multi-agent collaboration for LLM reasoning
par: Wang, Xiao, et autres
Publié: (2025)
par: Wang, Xiao, et autres
Publié: (2025)
ContrastScore: Towards Higher Quality, Less Biased, More Efficient Evaluation Metrics with Contrastive Evaluation
par: Wang, Xiao, et autres
Publié: (2025)
par: Wang, Xiao, et autres
Publié: (2025)
LLLMs: A Data-Driven Survey of Evolving Research on Limitations of Large Language Models
par: Kostikova, Aida, et autres
Publié: (2025)
par: Kostikova, Aida, et autres
Publié: (2025)
Fine-Grained Detection of Solidarity for Women and Migrants in 155 Years of German Parliamentary Debates
par: Kostikova, Aida, et autres
Publié: (2022)
par: Kostikova, Aida, et autres
Publié: (2022)
AIstorian lets AI be a historian: A KG-powered multi-agent system for accurate biography generation
par: Li, Fengyu, et autres
Publié: (2025)
par: Li, Fengyu, et autres
Publié: (2025)
Research on Tibetan Tourism Viewpoints information generation system based on LLM
par: Qi, Jinhu, et autres
Publié: (2024)
par: Qi, Jinhu, et autres
Publié: (2024)
The author is dead, but what if they never lived? A reception experiment on Czech AI- and human-authored poetry
par: Marklová, Anna, et autres
Publié: (2025)
par: Marklová, Anna, et autres
Publié: (2025)
TikZero: Zero-Shot Text-Guided Graphics Program Synthesis
par: Belouadi, Jonas, et autres
Publié: (2025)
par: Belouadi, Jonas, et autres
Publié: (2025)
Inherent and emergent liability issues in LLM-based agentic systems: a principal-agent perspective
par: Gabison, Garry A., et autres
Publié: (2025)
par: Gabison, Garry A., et autres
Publié: (2025)
Documents similaires
-
LiTransProQA: an LLM-based Literary Translation evaluation metric with Professional Question Answering
par: Zhang, Ran, et autres
Publié: (2025) -
PromptOptMe: Error-Aware Prompt Compression for LLM-based MT Evaluation Metrics
par: Larionov, Daniil, et autres
Publié: (2024) -
Do Emotions Really Affect Argument Convincingness? A Dynamic Approach with LLM-based Manipulation Checks
par: Chen, Yanran, et autres
Publié: (2025) -
Cross-lingual Cross-temporal Summarization: Dataset, Models, Evaluation
par: Zhang, Ran, et autres
Publié: (2023) -
How Good Are LLMs for Literary Translation, Really? Literary Translation Evaluation with Humans and LLMs
par: Zhang, Ran, et autres
Publié: (2024)