Salvato in:
| Autori principali: | Mahmood, Alhasan, Abdaljalil, Samir, Kurban, Hasan |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | https://arxiv.org/abs/2604.04532 |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Evaluating Multilingual and Code-Switched Alignment in LLMs via Synthetic Natural Language Inference
di: Abdaljalil, Samir, et al.
Pubblicazione: (2025)
di: Abdaljalil, Samir, et al.
Pubblicazione: (2025)
HalluVerse25: Fine-grained Multilingual Benchmark Dataset for LLM Hallucinations
di: Abdaljalil, Samir, et al.
Pubblicazione: (2025)
di: Abdaljalil, Samir, et al.
Pubblicazione: (2025)
Theorem-of-Thought: A Multi-Agent Framework for Abductive, Deductive, and Inductive Reasoning in Language Models
di: Abdaljalil, Samir, et al.
Pubblicazione: (2025)
di: Abdaljalil, Samir, et al.
Pubblicazione: (2025)
Knowing When Not to Answer: Abstention-Aware Scientific Reasoning
di: Abdaljalil, Samir, et al.
Pubblicazione: (2026)
di: Abdaljalil, Samir, et al.
Pubblicazione: (2026)
Audit-of-Understanding: Posterior-Constrained Inference for Mathematical Reasoning in Language Models
di: Abdaljalil, Samir, et al.
Pubblicazione: (2025)
di: Abdaljalil, Samir, et al.
Pubblicazione: (2025)
Halluverse-M^3: A multitask multilingual benchmark for hallucination in LLMs
di: Abdaljalil, Samir, et al.
Pubblicazione: (2026)
di: Abdaljalil, Samir, et al.
Pubblicazione: (2026)
SINdex: Semantic INconsistency Index for Hallucination Detection in LLMs
di: Abdaljalil, Samir, et al.
Pubblicazione: (2025)
di: Abdaljalil, Samir, et al.
Pubblicazione: (2025)
4D Synchronized Fields: Motion-Language Gaussian Splatting for Temporal Scene Understanding
di: Barhdadi, Mohamed Rayan, et al.
Pubblicazione: (2026)
di: Barhdadi, Mohamed Rayan, et al.
Pubblicazione: (2026)
SAFE: A Sparse Autoencoder-Based Framework for Robust Query Enrichment and Hallucination Mitigation in LLMs
di: Abdaljalil, Samir, et al.
Pubblicazione: (2025)
di: Abdaljalil, Samir, et al.
Pubblicazione: (2025)
Agent-as-a-Judge
di: You, Runyang, et al.
Pubblicazione: (2026)
di: You, Runyang, et al.
Pubblicazione: (2026)
When Chain-of-Thought Backfires: Evaluating Prompt Sensitivity in Medical Language Models
di: Sadanandan, Binesh, et al.
Pubblicazione: (2026)
di: Sadanandan, Binesh, et al.
Pubblicazione: (2026)
Beyond LLM-as-a-Judge: Deterministic Metrics for Multilingual Generative Text Evaluation
di: Alam, Firoj, et al.
Pubblicazione: (2026)
di: Alam, Firoj, et al.
Pubblicazione: (2026)
Sentient Agent as a Judge: Evaluating Higher-Order Social Cognition in Large Language Models
di: Zhang, Bang, et al.
Pubblicazione: (2025)
di: Zhang, Bang, et al.
Pubblicazione: (2025)
Judging the Judges: Evaluating Alignment and Vulnerabilities in LLMs-as-Judges
di: Thakur, Aman Singh, et al.
Pubblicazione: (2024)
di: Thakur, Aman Singh, et al.
Pubblicazione: (2024)
GHaLIB: A Multilingual Framework for Hope Speech Detection in Low-Resource Languages
di: Abdullah, Ahmed, et al.
Pubblicazione: (2025)
di: Abdullah, Ahmed, et al.
Pubblicazione: (2025)
M-Prometheus: A Suite of Open Multilingual LLM Judges
di: Pombal, José, et al.
Pubblicazione: (2025)
di: Pombal, José, et al.
Pubblicazione: (2025)
Mind2Web 2: Evaluating Agentic Search with Agent-as-a-Judge
di: Gou, Boyu, et al.
Pubblicazione: (2025)
di: Gou, Boyu, et al.
Pubblicazione: (2025)
Gaming the Judge: Unfaithful Chain-of-Thought Can Undermine Agent Evaluation
di: Khalifa, Muhammad, et al.
Pubblicazione: (2026)
di: Khalifa, Muhammad, et al.
Pubblicazione: (2026)
Words as Beacons: Guiding RL Agents with High-Level Language Prompts
di: Ruiz-Gonzalez, Unai, et al.
Pubblicazione: (2024)
di: Ruiz-Gonzalez, Unai, et al.
Pubblicazione: (2024)
Judging Quality Across Languages: A Multilingual Approach to Pretraining Data Filtering with Language Models
di: Ali, Mehdi, et al.
Pubblicazione: (2025)
di: Ali, Mehdi, et al.
Pubblicazione: (2025)
The Roles of English in Evaluating Multilingual Language Models
di: Poelman, Wessel, et al.
Pubblicazione: (2024)
di: Poelman, Wessel, et al.
Pubblicazione: (2024)
Mitigating Translationese Bias in Multilingual LLM-as-a-Judge via Disentangled Information Bottleneck
di: Zhang, Hongbin, et al.
Pubblicazione: (2026)
di: Zhang, Hongbin, et al.
Pubblicazione: (2026)
LLM-RadJudge: Achieving Radiologist-Level Evaluation for X-Ray Report Generation
di: Wang, Zilong, et al.
Pubblicazione: (2024)
di: Wang, Zilong, et al.
Pubblicazione: (2024)
JudgeAgent: Beyond Static Benchmarks for Knowledge-Driven and Dynamic LLM Evaluation
di: Shi, Zhichao, et al.
Pubblicazione: (2025)
di: Shi, Zhichao, et al.
Pubblicazione: (2025)
Multilingual Training and Evaluation Resources for Vision-Language Models
di: Baiamonte, Daniela, et al.
Pubblicazione: (2026)
di: Baiamonte, Daniela, et al.
Pubblicazione: (2026)
MCJudgeBench: A Benchmark for Constraint-Level Judge Evaluation in Multi-Constraint Instruction Following
di: Lee, Jaeyun, et al.
Pubblicazione: (2026)
di: Lee, Jaeyun, et al.
Pubblicazione: (2026)
The Tower of Babel Revisited: Multilingual Jailbreak Prompts on Closed-Source Large Language Models
di: Huang, Linghan, et al.
Pubblicazione: (2025)
di: Huang, Linghan, et al.
Pubblicazione: (2025)
Is It Good Data for Multilingual Instruction Tuning or Just Bad Multilingual Evaluation for Large Language Models?
di: Chen, Pinzhen, et al.
Pubblicazione: (2024)
di: Chen, Pinzhen, et al.
Pubblicazione: (2024)
Dimension-Level Intent Fidelity Evaluation for Large Language Models: Evidence from Structured Prompt Ablation
di: Peng, GAng
Pubblicazione: (2026)
di: Peng, GAng
Pubblicazione: (2026)
Benchmarking Prompt Sensitivity in Large Language Models
di: Razavi, Amirhossein, et al.
Pubblicazione: (2025)
di: Razavi, Amirhossein, et al.
Pubblicazione: (2025)
JudgeBoard: Benchmarking and Enhancing Small Language Models for Reasoning Evaluation
di: Bi, Zhenyu, et al.
Pubblicazione: (2025)
di: Bi, Zhenyu, et al.
Pubblicazione: (2025)
Systematic Weight Evaluation for Pruning Large Language Models: Enhancing Performance and Sustainability
di: Islam, Ashhadul, et al.
Pubblicazione: (2025)
di: Islam, Ashhadul, et al.
Pubblicazione: (2025)
Flaw or Artifact? Rethinking Prompt Sensitivity in Evaluating LLMs
di: Hua, Andong, et al.
Pubblicazione: (2025)
di: Hua, Andong, et al.
Pubblicazione: (2025)
Evaluating LLM-Based Goal Extraction in Requirements Engineering: Prompting Strategies and Their Limitations
di: Arnaudo, Anna, et al.
Pubblicazione: (2026)
di: Arnaudo, Anna, et al.
Pubblicazione: (2026)
MTQ-Eval: Multilingual Text Quality Evaluation for Language Models
di: Pokharel, Rhitabrat, et al.
Pubblicazione: (2025)
di: Pokharel, Rhitabrat, et al.
Pubblicazione: (2025)
Self-Prompting Small Language Models for Privacy-Sensitive Clinical Information Extraction
di: Chuang, Yao-Shun, et al.
Pubblicazione: (2026)
di: Chuang, Yao-Shun, et al.
Pubblicazione: (2026)
JAILJUDGE: A Comprehensive Jailbreak Judge Benchmark with Multi-Agent Enhanced Explanation Evaluation Framework
di: Liu, Fan, et al.
Pubblicazione: (2024)
di: Liu, Fan, et al.
Pubblicazione: (2024)
Prompting with Phonemes: Enhancing LLMs' Multilinguality for Non-Latin Script Languages
di: Nguyen, Hoang H, et al.
Pubblicazione: (2024)
di: Nguyen, Hoang H, et al.
Pubblicazione: (2024)
JudgeLM: Fine-tuned Large Language Models are Scalable Judges
di: Zhu, Lianghui, et al.
Pubblicazione: (2023)
di: Zhu, Lianghui, et al.
Pubblicazione: (2023)
Evaluating Metrics for Safety with LLM-as-Judges
di: Clegg, Kester, et al.
Pubblicazione: (2025)
di: Clegg, Kester, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Evaluating Multilingual and Code-Switched Alignment in LLMs via Synthetic Natural Language Inference
di: Abdaljalil, Samir, et al.
Pubblicazione: (2025) -
HalluVerse25: Fine-grained Multilingual Benchmark Dataset for LLM Hallucinations
di: Abdaljalil, Samir, et al.
Pubblicazione: (2025) -
Theorem-of-Thought: A Multi-Agent Framework for Abductive, Deductive, and Inductive Reasoning in Language Models
di: Abdaljalil, Samir, et al.
Pubblicazione: (2025) -
Knowing When Not to Answer: Abstention-Aware Scientific Reasoning
di: Abdaljalil, Samir, et al.
Pubblicazione: (2026) -
Audit-of-Understanding: Posterior-Constrained Inference for Mathematical Reasoning in Language Models
di: Abdaljalil, Samir, et al.
Pubblicazione: (2025)