SCORE: Specificity, Context Utilization, Robustness, and Relevance for Reference-Free LLM Evaluation
Fuente:
arXiv
Saved in:
| Main Authors: | Shomee, Homaira Huda, Chaturvedi, Rochana, Xie, Yangxinyu, Mallick, Tanwi |
|---|---|
| Format: | Preprint |
| Published: |
2026
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Comparative Evaluation of Prompting and Fine-Tuning for Applying Large Language Models to Grid-Structured Geospatial Data
by: Dhruv, Akash, et al.
Published: (2025)
by: Dhruv, Akash, et al.
Published: (2025)
PATENTWRITER: A Benchmarking Study for Patent Drafting with LLMs
by: Shomee, Homaira Huda, et al.
Published: (2025)
by: Shomee, Homaira Huda, et al.
Published: (2025)
Debiasing Watermarks for Large Language Models via Maximal Coupling
by: Xie, Yangxinyu, et al.
Published: (2024)
by: Xie, Yangxinyu, et al.
Published: (2024)
Who Gets the Callback? Generative AI and Gender Bias
by: Chaturvedi, Sugat, et al.
Published: (2025)
by: Chaturvedi, Sugat, et al.
Published: (2025)
LUMINA: Detecting Hallucinations in RAG System with Context-Knowledge Signals
by: Yeh, Samuel, et al.
Published: (2025)
by: Yeh, Samuel, et al.
Published: (2025)
MOSAIC: Multi-agent Orchestration for Task-Intelligent Scientific Coding
by: Raghavan, Siddeshwar, et al.
Published: (2025)
by: Raghavan, Siddeshwar, et al.
Published: (2025)
Empowering Older Adults in Digital Technology Use with Foundation Models
by: Sharifi, Hasti, et al.
Published: (2026)
by: Sharifi, Hasti, et al.
Published: (2026)
Bridging or Breaking: Impact of Intergroup Interactions on Religious Polarization
by: Chaturvedi, Rochana, et al.
Published: (2024)
by: Chaturvedi, Rochana, et al.
Published: (2024)
DesignCLIP: Multimodal Learning with CLIP for Design Patent Understanding
by: Wang, Zhu, et al.
Published: (2025)
by: Wang, Zhu, et al.
Published: (2025)
A Peek into Token Bias: Large Language Models Are Not Yet Genuine Reasoners
by: Jiang, Bowen, et al.
Published: (2024)
by: Jiang, Bowen, et al.
Published: (2024)
GeoGrid-Bench: Can Foundation Models Understand Multimodal Gridded Geo-Spatial Data?
by: Jiang, Bowen, et al.
Published: (2025)
by: Jiang, Bowen, et al.
Published: (2025)
Towards Rationality in Language and Multimodal Agents: A Survey
by: Jiang, Bowen, et al.
Published: (2024)
by: Jiang, Bowen, et al.
Published: (2024)
A RAG-Based Multi-Agent LLM System for Natural Hazard Resilience and Adaptation
by: Xie, Yangxinyu, et al.
Published: (2025)
by: Xie, Yangxinyu, et al.
Published: (2025)
ChatVis: Automating Scientific Visualization with a Large Language Model
by: Mallick, Tanwi, et al.
Published: (2024)
by: Mallick, Tanwi, et al.
Published: (2024)
Toward Reliable, Safe, and Secure LLMs for Scientific Applications
by: Chaturvedi, Saket Sanjeev, et al.
Published: (2026)
by: Chaturvedi, Saket Sanjeev, et al.
Published: (2026)
A Survey on Patent Analysis: From NLP to Multimodal AI
by: Shomee, Homaira Huda, et al.
Published: (2024)
by: Shomee, Homaira Huda, et al.
Published: (2024)
Aspect-oriented Consumer Health Answer Summarization
by: Chaturvedi, Rochana, et al.
Published: (2024)
by: Chaturvedi, Rochana, et al.
Published: (2024)
SCORE: Systematic COnsistency and Robustness Evaluation for Large Language Models
by: Nalbandyan, Grigor, et al.
Published: (2025)
by: Nalbandyan, Grigor, et al.
Published: (2025)
Measuring the Robustness of Reference-Free Dialogue Evaluation Systems
by: Vasselli, Justin, et al.
Published: (2025)
by: Vasselli, Justin, et al.
Published: (2025)
CC30k: A Citation Contexts Dataset for Reproducibility-Oriented Sentiment Analysis
by: Obadage, Rochana R., et al.
Published: (2025)
by: Obadage, Rochana R., et al.
Published: (2025)
Who Gets the Reward, Who Gets the Blame? Evaluation-Aligned Training Signals for Multi-LLM Agents
by: Yang, Chih-Hsuan, et al.
Published: (2025)
by: Yang, Chih-Hsuan, et al.
Published: (2025)
TrustScore: Reference-Free Evaluation of LLM Response Trustworthiness
by: Zheng, Danna, et al.
Published: (2024)
by: Zheng, Danna, et al.
Published: (2024)
Factuality Beyond Coherence: Evaluating LLM Watermarking Methods for Medical Texts
by: Hastuti, Rochana Prih, et al.
Published: (2025)
by: Hastuti, Rochana Prih, et al.
Published: (2025)
Temporal Relation Extraction in Clinical Texts: A Span-based Graph Transformer Approach
by: Chaturvedi, Rochana, et al.
Published: (2025)
by: Chaturvedi, Rochana, et al.
Published: (2025)
Evaluating the Utility of Grounding Documents with Reference-Free LLM-based Metrics
by: Hua, Yilun, et al.
Published: (2026)
by: Hua, Yilun, et al.
Published: (2026)
Evaluating the Robustness and Accuracy of Text Watermarking Under Real-World Cross-Lingual Manipulations
by: Ghanim, Mansour Al, et al.
Published: (2025)
by: Ghanim, Mansour Al, et al.
Published: (2025)
Reference-Free Evaluation of Taxonomies
by: Wullschleger, Pascal, et al.
Published: (2025)
by: Wullschleger, Pascal, et al.
Published: (2025)
ReSCORE: Label-free Iterative Retriever Training for Multi-hop Question Answering with Relevance-Consistency Supervision
by: Lee, Dosung, et al.
Published: (2025)
by: Lee, Dosung, et al.
Published: (2025)
Make Your LLM Fully Utilize the Context
by: An, Shengnan, et al.
Published: (2024)
by: An, Shengnan, et al.
Published: (2024)
Structured Packing in LLM Training Improves Long Context Utilization
by: Staniszewski, Konrad, et al.
Published: (2023)
by: Staniszewski, Konrad, et al.
Published: (2023)
Early Risk Prediction with Temporally and Contextually Grounded Clinical Language Processing
by: Chaturvedi, Rochana, et al.
Published: (2025)
by: Chaturvedi, Rochana, et al.
Published: (2025)
Mil-SCORE: Benchmarking Long-Context Geospatial Reasoning and Planning in Large Language Models
by: Palnitkar, Aadi, et al.
Published: (2026)
by: Palnitkar, Aadi, et al.
Published: (2026)
Domain-Specific Shorthand for Generation Based on Context-Free Grammar
by: Kanyuka, Andriy, et al.
Published: (2024)
by: Kanyuka, Andriy, et al.
Published: (2024)
How to Choose How to Choose Your Chatbot: A Massively Multi-System MultiReference Data Set for Dialog Metric Evaluation
by: Khayrallah, Huda, et al.
Published: (2023)
by: Khayrallah, Huda, et al.
Published: (2023)
CausalScore: An Automatic Reference-Free Metric for Assessing Response Relevance in Open-Domain Dialogue Systems
by: Feng, Tao, et al.
Published: (2024)
by: Feng, Tao, et al.
Published: (2024)
An Examination of the Robustness of Reference-Free Image Captioning Evaluation Metrics
by: Ahmadi, Saba, et al.
Published: (2023)
by: Ahmadi, Saba, et al.
Published: (2023)
SCORE: A Semantic Evaluation Framework for Generative Document Parsing
by: Li, Renyu, et al.
Published: (2025)
by: Li, Renyu, et al.
Published: (2025)
Analyzing Regional Impacts of Climate Change using Natural Language Processing Techniques
by: Mallick, Tanwi, et al.
Published: (2024)
by: Mallick, Tanwi, et al.
Published: (2024)
Sentinel: Decoding Context Utilization via Attention Probing for Efficient LLM Context Compression
by: Zhang, Yong, et al.
Published: (2025)
by: Zhang, Yong, et al.
Published: (2025)
MILE-RefHumEval: A Reference-Free, Multi-Independent LLM Framework for Human-Aligned Evaluation
by: Srun, Nalin, et al.
Published: (2026)
by: Srun, Nalin, et al.
Published: (2026)
Similar Items
-
Comparative Evaluation of Prompting and Fine-Tuning for Applying Large Language Models to Grid-Structured Geospatial Data
by: Dhruv, Akash, et al.
Published: (2025) -
PATENTWRITER: A Benchmarking Study for Patent Drafting with LLMs
by: Shomee, Homaira Huda, et al.
Published: (2025) -
Debiasing Watermarks for Large Language Models via Maximal Coupling
by: Xie, Yangxinyu, et al.
Published: (2024) -
Who Gets the Callback? Generative AI and Gender Bias
by: Chaturvedi, Sugat, et al.
Published: (2025) -
LUMINA: Detecting Hallucinations in RAG System with Context-Knowledge Signals
by: Yeh, Samuel, et al.
Published: (2025)