Same Meaning, Different Scores: Lexical and Syntactic Sensitivity in LLM Evaluation
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Kostić, Bogdan, Fallon, Conor, Risch, Julian, Löser, Alexander |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
VISLA Benchmark: Evaluating Embedding Sensitivity to Semantic and Lexical Alterations
par: Dumpala, Sri Harsha, et autres
Publié: (2024)
par: Dumpala, Sri Harsha, et autres
Publié: (2024)
Same Patient, Different Words, Different Diagnosis? Evaluating Semantic Stability in Clinical LLMs
par: Alkaeed, Mahdi, et autres
Publié: (2026)
par: Alkaeed, Mahdi, et autres
Publié: (2026)
ParaFusion: A Large-Scale LLM-Driven English Paraphrase Dataset Infused with High-Quality Lexical and Syntactic Diversity
par: Jayawardena, Lasal, et autres
Publié: (2024)
par: Jayawardena, Lasal, et autres
Publié: (2024)
The Same But Different: Structural Similarities and Differences in Multilingual Language Modeling
par: Zhang, Ruochen, et autres
Publié: (2024)
par: Zhang, Ruochen, et autres
Publié: (2024)
Unveiling the Lexical Sensitivity of LLMs: Combinatorial Optimization for Prompt Enhancement
par: Zhan, Pengwei, et autres
Publié: (2024)
par: Zhan, Pengwei, et autres
Publié: (2024)
A Linguistics-Aware LLM Watermarking via Syntactic Predictability
par: Park, Shinwoo, et autres
Publié: (2025)
par: Park, Shinwoo, et autres
Publié: (2025)
Lost in Sampling: Assessing Lexical Reachability in LLMs via the Word Coverage Score (WCS)
par: Awad, Samer, et autres
Publié: (2026)
par: Awad, Samer, et autres
Publié: (2026)
BERT-as-a-Judge: A Robust Alternative to Lexical Methods for Efficient Reference-Based LLM Evaluation
par: Gisserot-Boukhlef, Hippolyte, et autres
Publié: (2026)
par: Gisserot-Boukhlef, Hippolyte, et autres
Publié: (2026)
Fabricator: An Open Source Toolkit for Generating Labeled Training Data with Teacher LLMs
par: Golde, Jonas, et autres
Publié: (2023)
par: Golde, Jonas, et autres
Publié: (2023)
Evaluating Semantic and Syntactic Understanding in Large Language Models for Payroll Systems
par: Maclean, Hendrika, et autres
Publié: (2026)
par: Maclean, Hendrika, et autres
Publié: (2026)
Syntactic Language Change in English and German: Metrics, Parsers, and Convergences
par: Chen, Yanran, et autres
Publié: (2024)
par: Chen, Yanran, et autres
Publié: (2024)
Syntactic Evolution in Language Usage
par: Kumar, Surbhit
Publié: (2025)
par: Kumar, Surbhit
Publié: (2025)
Silicon Bureaucracy and AI Test-Oriented Education: Contamination Sensitivity and Score Confidence in LLM Benchmarks
par: Song, Yiliang, et autres
Publié: (2026)
par: Song, Yiliang, et autres
Publié: (2026)
Language Model Re-rankers are Fooled by Lexical Similarities
par: Hagström, Lovisa, et autres
Publié: (2025)
par: Hagström, Lovisa, et autres
Publié: (2025)
Confident Rankings with Fewer Items: Adaptive LLM Evaluation with Continuous Scores
par: Balkır, Esma, et autres
Publié: (2026)
par: Balkır, Esma, et autres
Publié: (2026)
Beyond Pointwise Scores: Decomposed Criteria-Based Evaluation of LLM Responses
par: Yu, Fangyi, et autres
Publié: (2025)
par: Yu, Fangyi, et autres
Publié: (2025)
PatentScore: Multi-dimensional Evaluation of LLM-Generated Patent Claims
par: Yoo, Yongmin, et autres
Publié: (2025)
par: Yoo, Yongmin, et autres
Publié: (2025)
Word Sense Disambiguation in Native Spanish: A Comprehensive Lexical Evaluation Resource
par: Ortega, Pablo, et autres
Publié: (2024)
par: Ortega, Pablo, et autres
Publié: (2024)
LexInstructEval: Lexical Instruction Following Evaluation for Large Language Models
par: Ren, Huimin, et autres
Publié: (2025)
par: Ren, Huimin, et autres
Publié: (2025)
Same Evidence, Different Answers: Canonical-Context On-Policy Distillation for Multi-Turn Language Models
par: Lin, Zizhuo, et autres
Publié: (2026)
par: Lin, Zizhuo, et autres
Publié: (2026)
Simulating Meaning, Nevermore! Introducing ICR: A Semiotic-Hermeneutic Metric for Evaluating Meaning in LLM Text Summaries
par: Perez, Natalie, et autres
Publié: (2026)
par: Perez, Natalie, et autres
Publié: (2026)
In-Situ Behavioral Evaluation for LLM Fairness, Not Standardized-Test Scores
par: Tang, Zeyu, et autres
Publié: (2026)
par: Tang, Zeyu, et autres
Publié: (2026)
STED and Consistency Scoring: A Framework for Evaluating LLM Structured Output Reliability
par: Wang, Guanghui, et autres
Publié: (2025)
par: Wang, Guanghui, et autres
Publié: (2025)
Using Grammar Masking to Ensure Syntactic Validity in LLM-based Modeling Tasks
par: Netz, Lukas, et autres
Publié: (2024)
par: Netz, Lukas, et autres
Publié: (2024)
Negation Triplet Extraction with Syntactic Dependency and Semantic Consistency
par: Shi, Yuchen, et autres
Publié: (2024)
par: Shi, Yuchen, et autres
Publié: (2024)
DiffScore: Text Evaluation Beyond Autoregressive Likelihood
par: Lai, Wen, et autres
Publié: (2026)
par: Lai, Wen, et autres
Publié: (2026)
Same Question, Different Source, Different Answer: Auditing Source-Dependence in Medical Multi-Source RAG
par: Li, Yubo, et autres
Publié: (2026)
par: Li, Yubo, et autres
Publié: (2026)
Emergence of Phonemic, Syntactic, and Semantic Representations in Artificial Neural Networks
par: Orhan, Pierre, et autres
Publié: (2026)
par: Orhan, Pierre, et autres
Publié: (2026)
The Role of Syntactic Span Preferences in Post-Hoc Explanation Disagreement
par: Kamp, Jonathan, et autres
Publié: (2024)
par: Kamp, Jonathan, et autres
Publié: (2024)
A Systematic Study of Compositional Syntactic Transformer Language Models
par: Zhao, Yida, et autres
Publié: (2025)
par: Zhao, Yida, et autres
Publié: (2025)
This Treatment Works, Right? Evaluating LLM Sensitivity to Patient Question Framing in Medical QA
par: Yun, Hye Sun, et autres
Publié: (2026)
par: Yun, Hye Sun, et autres
Publié: (2026)
Less Context, Same Performance: A RAG Framework for Resource-Efficient LLM-Based Clinical NLP
par: Cheetirala, Satya Narayana, et autres
Publié: (2025)
par: Cheetirala, Satya Narayana, et autres
Publié: (2025)
Same Question, Different Words: A Latent Adversarial Framework for Prompt Robustness
par: Fu, Tingchen, et autres
Publié: (2025)
par: Fu, Tingchen, et autres
Publié: (2025)
CASTILLO: Characterizing Response Length Distributions of Large Language Models
par: Perez-Ramirez, Daniel F., et autres
Publié: (2025)
par: Perez-Ramirez, Daniel F., et autres
Publié: (2025)
Graph Neural Network Framework for Sentiment Analysis Using Syntactic Feature
par: Wu, Linxiao, et autres
Publié: (2024)
par: Wu, Linxiao, et autres
Publié: (2024)
Generative Pretrained Structured Transformers: Unsupervised Syntactic Language Models at Scale
par: Hu, Xiang, et autres
Publié: (2024)
par: Hu, Xiang, et autres
Publié: (2024)
Evaluating Memory in LLM Agents via Incremental Multi-Turn Interactions
par: Hu, Yuanzhe, et autres
Publié: (2025)
par: Hu, Yuanzhe, et autres
Publié: (2025)
Polysemanticity or Polysemy? Lexical Identity Confounds Superposition Metrics
par: Hou, Iyad Ait, et autres
Publié: (2026)
par: Hou, Iyad Ait, et autres
Publié: (2026)
Using Language Models to Disambiguate Lexical Choices in Translation
par: Barua, Josh, et autres
Publié: (2024)
par: Barua, Josh, et autres
Publié: (2024)
Measuring Meaning Composition in the Human Brain with Composition Scores from Large Language Models
par: Gao, Changjiang, et autres
Publié: (2024)
par: Gao, Changjiang, et autres
Publié: (2024)
Documents similaires
-
VISLA Benchmark: Evaluating Embedding Sensitivity to Semantic and Lexical Alterations
par: Dumpala, Sri Harsha, et autres
Publié: (2024) -
Same Patient, Different Words, Different Diagnosis? Evaluating Semantic Stability in Clinical LLMs
par: Alkaeed, Mahdi, et autres
Publié: (2026) -
ParaFusion: A Large-Scale LLM-Driven English Paraphrase Dataset Infused with High-Quality Lexical and Syntactic Diversity
par: Jayawardena, Lasal, et autres
Publié: (2024) -
The Same But Different: Structural Similarities and Differences in Multilingual Language Modeling
par: Zhang, Ruochen, et autres
Publié: (2024) -
Unveiling the Lexical Sensitivity of LLMs: Combinatorial Optimization for Prompt Enhancement
par: Zhan, Pengwei, et autres
Publié: (2024)