Evaluating LLM Metrics Through Real-World Capabilities
Fuente:
arXiv
Salvato in:
| Autori principali: | Miller, Justin K, Tang, Wenjia |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Understanding LLM Evaluator Behavior: A Structured Multi-Evaluator Framework for Merchant Risk Assessment
di: Wang, Liang, et al.
Pubblicazione: (2026)
di: Wang, Liang, et al.
Pubblicazione: (2026)
LLMs are Capable of Misaligned Behavior Under Explicit Prohibition and Surveillance
di: Ivanov, Igor
Pubblicazione: (2025)
di: Ivanov, Igor
Pubblicazione: (2025)
AI Predicts AGI: Leveraging AGI Forecasting and Peer Review to Explore LLMs' Complex Reasoning Capabilities
di: Davide, Fabrizio, et al.
Pubblicazione: (2024)
di: Davide, Fabrizio, et al.
Pubblicazione: (2024)
Deciphering Digital Detectives: Understanding LLM Behaviors and Capabilities in Multi-Agent Mystery Games
di: Wu, Dekun, et al.
Pubblicazione: (2023)
di: Wu, Dekun, et al.
Pubblicazione: (2023)
Planning vs Reasoning: Ablations to Test Capabilities of LoRA layers
di: Redkar, Neel
Pubblicazione: (2024)
di: Redkar, Neel
Pubblicazione: (2024)
SagaLLM: Context Management, Validation, and Transaction Guarantees for Multi-Agent LLM Planning
di: Chang, Edward Y., et al.
Pubblicazione: (2025)
di: Chang, Edward Y., et al.
Pubblicazione: (2025)
Evaluating the efficacy of LLM Safety Solutions : The Palit Benchmark Dataset
di: Palit, Sayon, et al.
Pubblicazione: (2025)
di: Palit, Sayon, et al.
Pubblicazione: (2025)
A Library of LLM Intrinsics for Retrieval-Augmented Generation
di: Danilevsky, Marina, et al.
Pubblicazione: (2025)
di: Danilevsky, Marina, et al.
Pubblicazione: (2025)
Diagnosing and Mitigating Sycophancy and Skepticism in LLM Causal Judgment
di: Chang, Edward Y.
Pubblicazione: (2026)
di: Chang, Edward Y.
Pubblicazione: (2026)
Toward Architecture-Aware Evaluation Metrics for LLM Agents
di: Souza, Débora, et al.
Pubblicazione: (2026)
di: Souza, Débora, et al.
Pubblicazione: (2026)
A Benchmark for Audio Reasoning Capabilities of Multimodal Large Language Models
di: Christop, Iwona, et al.
Pubblicazione: (2026)
di: Christop, Iwona, et al.
Pubblicazione: (2026)
RomanLens: The Role Of Latent Romanization In Multilinguality In LLMs
di: Saji, Alan, et al.
Pubblicazione: (2025)
di: Saji, Alan, et al.
Pubblicazione: (2025)
Text-Based Approaches to Item Difficulty Modeling in Large-Scale Assessments: A Systematic Review
di: Peters, Sydney, et al.
Pubblicazione: (2025)
di: Peters, Sydney, et al.
Pubblicazione: (2025)
Evaluating Relational Reasoning in LLMs with REL
di: Fesser, Lukas, et al.
Pubblicazione: (2026)
di: Fesser, Lukas, et al.
Pubblicazione: (2026)
ALAS: A Stateful Multi-LLM Agent Framework for Disruption-Aware Planning
di: Chang, Edward Y., et al.
Pubblicazione: (2025)
di: Chang, Edward Y., et al.
Pubblicazione: (2025)
LLM-based Automated Theorem Proving Hinges on Scalable Synthetic Data Generation
di: Lai, Junyu, et al.
Pubblicazione: (2025)
di: Lai, Junyu, et al.
Pubblicazione: (2025)
EVINCE: Optimizing Multi-LLM Dialogues Using Conditional Statistics and Information Theory
di: Chang, Edward Y.
Pubblicazione: (2024)
di: Chang, Edward Y.
Pubblicazione: (2024)
Evaluating the Efficacy of Hybrid Deep Learning Models in Distinguishing AI-Generated Text
di: Oketunji, Abiodun Finbarrs
Pubblicazione: (2023)
di: Oketunji, Abiodun Finbarrs
Pubblicazione: (2023)
Active Context Compression: Autonomous Memory Management in LLM Agents
di: Verma, Nikhil
Pubblicazione: (2026)
di: Verma, Nikhil
Pubblicazione: (2026)
Evaluating Steering Techniques using Human Similarity Judgments
di: Studdiford, Zach, et al.
Pubblicazione: (2025)
di: Studdiford, Zach, et al.
Pubblicazione: (2025)
Intrinsic Evaluation of RAG Systems for Deep-Logic Questions
di: Hu, Junyi, et al.
Pubblicazione: (2024)
di: Hu, Junyi, et al.
Pubblicazione: (2024)
KNOW: A Real-World Ontology for Knowledge Capture with Large Language Models
di: Bendiken, Arto
Pubblicazione: (2024)
di: Bendiken, Arto
Pubblicazione: (2024)
Applying Cognitive Design Patterns to General LLM Agents
di: Wray, Robert E., et al.
Pubblicazione: (2025)
di: Wray, Robert E., et al.
Pubblicazione: (2025)
Context Is What You Need: The Maximum Effective Context Window for Real World Limits of LLMs
di: Paulsen, Norman
Pubblicazione: (2025)
di: Paulsen, Norman
Pubblicazione: (2025)
DeEscalWild: A Real-World Benchmark for Automated De-Escalation Training with SLMs
di: Hasan, Md Hasebul, et al.
Pubblicazione: (2026)
di: Hasan, Md Hasebul, et al.
Pubblicazione: (2026)
Evaluating Voice Command Pipelines for Drone Control: From STT and LLM to Direct Classification and Siamese Networks
di: Simões, Lucca Emmanuel Pineli, et al.
Pubblicazione: (2024)
di: Simões, Lucca Emmanuel Pineli, et al.
Pubblicazione: (2024)
From Fake Focus to Real Precision: Confusion-Driven Adversarial Attention Learning in Transformers
di: Liu, Yawei
Pubblicazione: (2025)
di: Liu, Yawei
Pubblicazione: (2025)
Reasoning-Based AI for Startup Evaluation (R.A.I.S.E.): A Memory-Augmented, Multi-Step Decision Framework
di: Preuveneers, Jack, et al.
Pubblicazione: (2025)
di: Preuveneers, Jack, et al.
Pubblicazione: (2025)
CoE: Collaborative Entropy for Uncertainty Quantification in Agentic Multi-LLM Systems
di: Sun, Kangkang, et al.
Pubblicazione: (2026)
di: Sun, Kangkang, et al.
Pubblicazione: (2026)
Efficient LLM Safety Evaluation through Multi-Agent Debate
di: Lin, Dachuan, et al.
Pubblicazione: (2025)
di: Lin, Dachuan, et al.
Pubblicazione: (2025)
Instruction Complexity Induces Positional Collapse in Adversarial LLM Evaluation
di: Cacioli, Jon-Paul
Pubblicazione: (2026)
di: Cacioli, Jon-Paul
Pubblicazione: (2026)
CVE-Bench: A Benchmark for AI Agents' Ability to Exploit Real-World Web Application Vulnerabilities
di: Zhu, Yuxuan, et al.
Pubblicazione: (2025)
di: Zhu, Yuxuan, et al.
Pubblicazione: (2025)
Beyond the Mean: Within-Model Reliable Change Detection for LLM Evaluation
di: Cacioli, Jon-Paul
Pubblicazione: (2026)
di: Cacioli, Jon-Paul
Pubblicazione: (2026)
Evaluating Large Language Models on Historical Health Crisis Knowledge in Resource-Limited Settings: A Hybrid Multi-Metric Study
di: Hasan, Mohammed Rakibul
Pubblicazione: (2026)
di: Hasan, Mohammed Rakibul
Pubblicazione: (2026)
Generative Active Testing: Efficient LLM Evaluation via Proxy Task Adaptation
di: Ramakrishnan, Aashish Anantha, et al.
Pubblicazione: (2026)
di: Ramakrishnan, Aashish Anantha, et al.
Pubblicazione: (2026)
Large Language Model (LLM) Bias Index -- LLMBI
di: Oketunji, Abiodun Finbarrs, et al.
Pubblicazione: (2023)
di: Oketunji, Abiodun Finbarrs, et al.
Pubblicazione: (2023)
Grokking in the Wild: Data Augmentation for Real-World Multi-Hop Reasoning with Transformers
di: Abramov, Roman, et al.
Pubblicazione: (2025)
di: Abramov, Roman, et al.
Pubblicazione: (2025)
Knockout LLM Assessment: Using Large Language Models for Evaluations through Iterative Pairwise Comparisons
di: Sandan, Isik Baran, et al.
Pubblicazione: (2025)
di: Sandan, Isik Baran, et al.
Pubblicazione: (2025)
LLM-Based SQL Generation: Prompting, Self-Refinement, and Adaptive Weighted Majority Voting
di: Yang, Yu-Jie, et al.
Pubblicazione: (2026)
di: Yang, Yu-Jie, et al.
Pubblicazione: (2026)
Intention Collapse: Intention-Level Metrics for Reasoning in Language Models
di: Vera, Patricio
Pubblicazione: (2026)
di: Vera, Patricio
Pubblicazione: (2026)
Documenti analoghi
-
Understanding LLM Evaluator Behavior: A Structured Multi-Evaluator Framework for Merchant Risk Assessment
di: Wang, Liang, et al.
Pubblicazione: (2026) -
LLMs are Capable of Misaligned Behavior Under Explicit Prohibition and Surveillance
di: Ivanov, Igor
Pubblicazione: (2025) -
AI Predicts AGI: Leveraging AGI Forecasting and Peer Review to Explore LLMs' Complex Reasoning Capabilities
di: Davide, Fabrizio, et al.
Pubblicazione: (2024) -
Deciphering Digital Detectives: Understanding LLM Behaviors and Capabilities in Multi-Agent Mystery Games
di: Wu, Dekun, et al.
Pubblicazione: (2023) -
Planning vs Reasoning: Ablations to Test Capabilities of LoRA layers
di: Redkar, Neel
Pubblicazione: (2024)