VERITAS: A Unified Approach to Reliability Evaluation
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Ramamurthy, Rajkumar, Rajeev, Meghana Arakkal, Molenschot, Oliver, Zou, James, Rajani, Nazneen |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Self-rationalization improves LLM as a fine-grained judge
par: Trivedi, Prapti, et autres
Publié: (2024)
par: Trivedi, Prapti, et autres
Publié: (2024)
Impatient Users Confuse AI Agents: High-fidelity Simulations of Human Traits for Testing Agents
par: He, Muyu, et autres
Publié: (2025)
par: He, Muyu, et autres
Publié: (2025)
Cats Confuse Reasoning LLM: Query Agnostic Adversarial Triggers for Reasoning Models
par: Rajeev, Meghana, et autres
Publié: (2025)
par: Rajeev, Meghana, et autres
Publié: (2025)
Stage-wise Fine-tuning for Graph-to-Text Generation
par: Wang, Qingyun, et autres
Publié: (2021)
par: Wang, Qingyun, et autres
Publié: (2021)
ReviewRobot: Explainable Paper Review Generation based on Knowledge Synthesis
par: Wang, Qingyun, et autres
Publié: (2020)
par: Wang, Qingyun, et autres
Publié: (2020)
$\texttt{YC-Bench}$: Benchmarking AI Agents for Long-Term Planning and Consistent Execution
par: He, Muyu, et autres
Publié: (2026)
par: He, Muyu, et autres
Publié: (2026)
Cross-Examiner: Evaluating Consistency of Large Language Model-Generated Explanations
par: Villa, Danielle, et autres
Publié: (2025)
par: Villa, Danielle, et autres
Publié: (2025)
VERITAS-NLI : Validation and Extraction of Reliable Information Through Automated Scraping and Natural Language Inference
par: Shah, Arjun, et autres
Publié: (2024)
par: Shah, Arjun, et autres
Publié: (2024)
Sparsity May Be All You Need: Sparse Random Parameter Adaptation
par: Rios, Jesus, et autres
Publié: (2025)
par: Rios, Jesus, et autres
Publié: (2025)
LLM-Human Pipeline for Cultural Context Grounding of Conversations
par: Pujari, Rajkumar, et autres
Publié: (2024)
par: Pujari, Rajkumar, et autres
Publié: (2024)
Reasoning about concepts with LLMs: Inconsistencies abound
par: Uceda-Sosa, Rosario, et autres
Publié: (2024)
par: Uceda-Sosa, Rosario, et autres
Publié: (2024)
Evaluating Prompting Strategies with MedGemma for Medical Order Extraction
par: Balachandran, Abhinand, et autres
Publié: (2025)
par: Balachandran, Abhinand, et autres
Publié: (2025)
TruthEval: A Dataset to Evaluate LLM Truthfulness and Reliability
par: Khatun, Aisha, et autres
Publié: (2024)
par: Khatun, Aisha, et autres
Publié: (2024)
On Robustness and Reliability of Benchmark-Based Evaluation of LLMs
par: Lunardi, Riccardo, et autres
Publié: (2025)
par: Lunardi, Riccardo, et autres
Publié: (2025)
Naamah: A Large Scale Synthetic Sanskrit NER Corpus via DBpedia Seeding and LLM Generation
par: P, Akhil Rajeev, et autres
Publié: (2026)
par: P, Akhil Rajeev, et autres
Publié: (2026)
LitBench: A Benchmark and Dataset for Reliable Evaluation of Creative Writing
par: Fein, Daniel, et autres
Publié: (2025)
par: Fein, Daniel, et autres
Publié: (2025)
Towards Reliable Evaluation of Behavior Steering Interventions in LLMs
par: Pres, Itamar, et autres
Publié: (2024)
par: Pres, Itamar, et autres
Publié: (2024)
Do Repetitions Matter? Strengthening Reliability in LLM Evaluations
par: Gonzalez, Miguel Angel Alvarado, et autres
Publié: (2025)
par: Gonzalez, Miguel Angel Alvarado, et autres
Publié: (2025)
Automated Rubrics for Reliable Evaluation of Medical Dialogue Systems
par: Chen, Yinzhu, et autres
Publié: (2026)
par: Chen, Yinzhu, et autres
Publié: (2026)
VERT: Reliable LLM Judges for Radiology Report Evaluation
par: Bologna, Federica, et autres
Publié: (2026)
par: Bologna, Federica, et autres
Publié: (2026)
Efficacy of Various Large Language Models in Generating Smart Contracts
par: Chatterjee, Siddhartha, et autres
Publié: (2024)
par: Chatterjee, Siddhartha, et autres
Publié: (2024)
Mitigating Misalignment Contagion by Steering with Implicit Traits
par: Chang, Maria, et autres
Publié: (2026)
par: Chang, Maria, et autres
Publié: (2026)
Box Maze: A Process-Control Architecture for Reliable LLM Reasoning
par: Qiang, Zou
Publié: (2026)
par: Qiang, Zou
Publié: (2026)
STED and Consistency Scoring: A Framework for Evaluating LLM Structured Output Reliability
par: Wang, Guanghui, et autres
Publié: (2025)
par: Wang, Guanghui, et autres
Publié: (2025)
How Reliable Are Automatic Evaluation Methods for Instruction-Tuned LLMs?
par: Doostmohammadi, Ehsan, et autres
Publié: (2024)
par: Doostmohammadi, Ehsan, et autres
Publié: (2024)
Reliable Fine-Grained Evaluation of Natural Language Math Proofs
par: Ma, Wenjie, et autres
Publié: (2025)
par: Ma, Wenjie, et autres
Publié: (2025)
AgentCompass: Towards Reliable Evaluation of Agentic Workflows in Production
par: Kartik, NVJK, et autres
Publié: (2025)
par: Kartik, NVJK, et autres
Publié: (2025)
Evaluating the Prompt Steerability of Large Language Models
par: Miehling, Erik, et autres
Publié: (2024)
par: Miehling, Erik, et autres
Publié: (2024)
Autorubric: Unifying Rubric-based LLM Evaluation
par: Rao, Delip, et autres
Publié: (2026)
par: Rao, Delip, et autres
Publié: (2026)
Towards Reliable Detection of LLM-Generated Texts: A Comprehensive Evaluation Framework with CUDRT
par: Tao, Zhen, et autres
Publié: (2024)
par: Tao, Zhen, et autres
Publié: (2024)
Cost-of-Pass: An Economic Framework for Evaluating Language Models
par: Erol, Mehmet Hamza, et autres
Publié: (2025)
par: Erol, Mehmet Hamza, et autres
Publié: (2025)
LegalCiteBench: Evaluating Citation Reliability in Legal Language Models
par: Chen, Sijia, et autres
Publié: (2026)
par: Chen, Sijia, et autres
Publié: (2026)
Learning to Align Multi-Faceted Evaluation: A Unified and Robust Framework
par: Xu, Kaishuai, et autres
Publié: (2025)
par: Xu, Kaishuai, et autres
Publié: (2025)
Paper2Agent: Reimagining Research Papers As Interactive and Reliable AI Agents
par: Miao, Jiacheng, et autres
Publié: (2025)
par: Miao, Jiacheng, et autres
Publié: (2025)
CocoaBench: Evaluating Unified Digital Agents in the Wild
par: CocoaBench Team, et autres
Publié: (2026)
par: CocoaBench Team, et autres
Publié: (2026)
Commonsense for Zero-Shot Natural Language Video Localization
par: Holla, Meghana, et autres
Publié: (2023)
par: Holla, Meghana, et autres
Publié: (2023)
Leveraging Implicit Sentiments: Enhancing Reliability and Validity in Psychological Trait Evaluation of LLMs
par: Ma, Huanhuan, et autres
Publié: (2025)
par: Ma, Huanhuan, et autres
Publié: (2025)
AA-Omniscience: Evaluating Cross-Domain Knowledge Reliability in Large Language Models
par: Jackson, Declan, et autres
Publié: (2025)
par: Jackson, Declan, et autres
Publié: (2025)
Detecting and Mitigating Bias in LLMs through Knowledge Graph-Augmented Training
par: Kumar, Rajeev, et autres
Publié: (2025)
par: Kumar, Rajeev, et autres
Publié: (2025)
Mined Prompting and Metadata-Guided Generation for Wound Care Visual Question Answering
par: Durgapraveen, Bavana, et autres
Publié: (2025)
par: Durgapraveen, Bavana, et autres
Publié: (2025)
Documents similaires
-
Self-rationalization improves LLM as a fine-grained judge
par: Trivedi, Prapti, et autres
Publié: (2024) -
Impatient Users Confuse AI Agents: High-fidelity Simulations of Human Traits for Testing Agents
par: He, Muyu, et autres
Publié: (2025) -
Cats Confuse Reasoning LLM: Query Agnostic Adversarial Triggers for Reasoning Models
par: Rajeev, Meghana, et autres
Publié: (2025) -
Stage-wise Fine-tuning for Graph-to-Text Generation
par: Wang, Qingyun, et autres
Publié: (2021) -
ReviewRobot: Explainable Paper Review Generation based on Knowledge Synthesis
par: Wang, Qingyun, et autres
Publié: (2020)