ParliaBench: An Evaluation and Benchmarking Framework for LLM-Generated Parliamentary Speech
Fuente:
arXiv
Salvato in:
| Autori principali: | Koniaris, Marios, Tsipi, Argyro, Tsanakas, Panayiotis |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
The Table of Media Bias Elements: A sentence-level taxonomy of media bias types and propaganda techniques
di: Menzner, Tim, et al.
Pubblicazione: (2026)
di: Menzner, Tim, et al.
Pubblicazione: (2026)
Agentic Framework for Political Biography Extraction
di: Zhu, Yifei, et al.
Pubblicazione: (2026)
di: Zhu, Yifei, et al.
Pubblicazione: (2026)
ChronoMedKG: A Temporally-Grounded Biomedical Knowledge Graph and Benchmark for Clinical Reasoning
di: Ahmed, Md Shamim, et al.
Pubblicazione: (2026)
di: Ahmed, Md Shamim, et al.
Pubblicazione: (2026)
TransResAI: A Compound AI System for Coastal Transportation Resilience
di: Pu, Qingwen, et al.
Pubblicazione: (2026)
di: Pu, Qingwen, et al.
Pubblicazione: (2026)
Prompt-RAG: Pioneering Vector Embedding-Free Retrieval-Augmented Generation in Niche Domains, Exemplified by Korean Medicine
di: Kang, Bongsu, et al.
Pubblicazione: (2024)
di: Kang, Bongsu, et al.
Pubblicazione: (2024)
LLM-as-a-Judge: Rapid Evaluation of Legal Document Recommendation for Retrieval-Augmented Generation
di: Pradhan, Anu, et al.
Pubblicazione: (2025)
di: Pradhan, Anu, et al.
Pubblicazione: (2025)
NCTB-QA: A Large-Scale Bangla Educational Question Answering Dataset and Benchmarking Performance
di: Eyasir, Abrar, et al.
Pubblicazione: (2026)
di: Eyasir, Abrar, et al.
Pubblicazione: (2026)
An Interpretable Ensemble of Graph and Language Models for Improving Search Relevance in E-Commerce
di: Choudhary, Nurendra, et al.
Pubblicazione: (2024)
di: Choudhary, Nurendra, et al.
Pubblicazione: (2024)
PubMed Reasoner: Dynamic Reasoning-based Retrieval for Evidence-Grounded Biomedical Question Answering
di: Zhang, Yiqing, et al.
Pubblicazione: (2026)
di: Zhang, Yiqing, et al.
Pubblicazione: (2026)
Benchmarking Google Embeddings 2 against Open-Source Models for Multilingual Dense Retrieval and RAG Systems
di: Cirillo, Stefano, et al.
Pubblicazione: (2026)
di: Cirillo, Stefano, et al.
Pubblicazione: (2026)
NameBERT: Scaling Name-Based Nationality Classification with LLM-Augmented Open Academic Data
di: Ming, Cong, et al.
Pubblicazione: (2026)
di: Ming, Cong, et al.
Pubblicazione: (2026)
ARTAI: An Evaluation Platform to Assess Societal Risk of Recommender Algorithms
di: Ruan, Qin, et al.
Pubblicazione: (2024)
di: Ruan, Qin, et al.
Pubblicazione: (2024)
Extending AI for Research to the Humanities: A Multi-Agent Framework for Evidence-Grounded Scholarship
di: Pan, Yating, et al.
Pubblicazione: (2026)
di: Pan, Yating, et al.
Pubblicazione: (2026)
Evaluation of Chunking Strategies for Effective Text Embedding in Low-Resource Language on Agricultural Documents
di: Chhoun, Sovandara, et al.
Pubblicazione: (2026)
di: Chhoun, Sovandara, et al.
Pubblicazione: (2026)
BALI: Enhancing Biomedical Language Representations through Knowledge Graph and Language Model Alignment
di: Sakhovskiy, Andrey, et al.
Pubblicazione: (2025)
di: Sakhovskiy, Andrey, et al.
Pubblicazione: (2025)
AuthorityBench: Benchmarking LLM Authority Perception for Reliable Retrieval-Augmented Generation
di: Yao, Zhihui, et al.
Pubblicazione: (2026)
di: Yao, Zhihui, et al.
Pubblicazione: (2026)
Memory Architectures for Multi-Turn Text-to-SQL: A Benchmark and Empirical Study
di: Tummalapenta, Ravi Kumar, et al.
Pubblicazione: (2026)
di: Tummalapenta, Ravi Kumar, et al.
Pubblicazione: (2026)
Legal RAG Bench: an end-to-end benchmark for legal RAG
di: Butler, Abdur-Rahman, et al.
Pubblicazione: (2026)
di: Butler, Abdur-Rahman, et al.
Pubblicazione: (2026)
GISTBench: Evaluating LLM User Understanding via Evidence-Based Interest Verification
di: Fostiropoulos, Iordanis, et al.
Pubblicazione: (2026)
di: Fostiropoulos, Iordanis, et al.
Pubblicazione: (2026)
Leveraging LLMs to Create Content Corpora for Niche Domains
di: Zhang, Franklin, et al.
Pubblicazione: (2025)
di: Zhang, Franklin, et al.
Pubblicazione: (2025)
Flippi: End To End GenAI Assistant for E-Commerce
di: Rajasekar, Anand A., et al.
Pubblicazione: (2025)
di: Rajasekar, Anand A., et al.
Pubblicazione: (2025)
NewsScope: Schema-Grounded Cross-Domain News Claim Extraction with Open Models
di: Pandya, Nidhi
Pubblicazione: (2025)
di: Pandya, Nidhi
Pubblicazione: (2025)
Stage-Audit: Auditable Source-Frontier Discovery for Cross-Wiki Tables
di: Shen, Chen
Pubblicazione: (2026)
di: Shen, Chen
Pubblicazione: (2026)
Towards Adaptive Context Management for Intelligent Conversational Question Answering
di: Perera, Manoj Madushanka, et al.
Pubblicazione: (2025)
di: Perera, Manoj Madushanka, et al.
Pubblicazione: (2025)
Local Hybrid Retrieval-Augmented Document QA
di: Astrino, Paolo
Pubblicazione: (2025)
di: Astrino, Paolo
Pubblicazione: (2025)
FACTUM: Mechanistic Detection of Citation Hallucination in Long-Form RAG
di: Dassen, Maxime, et al.
Pubblicazione: (2026)
di: Dassen, Maxime, et al.
Pubblicazione: (2026)
Contextually Aware E-Commerce Product Question Answering using RAG
di: Tangarajan, Praveen, et al.
Pubblicazione: (2025)
di: Tangarajan, Praveen, et al.
Pubblicazione: (2025)
A Comparative Study of Language Models for Khmer Retrieval-Augmented Question Answering
di: Ros, Sereiwathna, et al.
Pubblicazione: (2026)
di: Ros, Sereiwathna, et al.
Pubblicazione: (2026)
Token-Oriented Object Notation vs JSON: A Benchmark of Plain and Constrained Decoding Generation
di: Matveev, Ivan
Pubblicazione: (2026)
di: Matveev, Ivan
Pubblicazione: (2026)
GPT has become financially literate: Insights from financial literacy tests of GPT and a preliminary test of how people use it as a source of advice
di: Niszczota, Paweł, et al.
Pubblicazione: (2023)
di: Niszczota, Paweł, et al.
Pubblicazione: (2023)
EQUATOR: A Deterministic Framework for Evaluating LLM Reasoning with Open-Ended Questions. # v1.0.0-beta
di: Bernard, Raymond, et al.
Pubblicazione: (2024)
di: Bernard, Raymond, et al.
Pubblicazione: (2024)
Semantic Reconstruction of Adversarial Plagiarism: A Context-Aware Framework for Detecting and Restoring "Tortured Phrases" in Scientific Literature
di: Maiti, Agniva, et al.
Pubblicazione: (2025)
di: Maiti, Agniva, et al.
Pubblicazione: (2025)
ESGBench: A Benchmark for Explainable ESG Question Answering in Corporate Sustainability Reports
di: George, Sherine, et al.
Pubblicazione: (2025)
di: George, Sherine, et al.
Pubblicazione: (2025)
Knowing Isn't Understanding: Re-grounding Generative Proactivity with Epistemic and Behavioral Insight
di: Kaur, Kirandeep, et al.
Pubblicazione: (2026)
di: Kaur, Kirandeep, et al.
Pubblicazione: (2026)
Less LLM, More Documents: Searching for Improved RAG
di: Ning, Jingjie, et al.
Pubblicazione: (2025)
di: Ning, Jingjie, et al.
Pubblicazione: (2025)
Temporal Decay of Co-Citation Predictability: A 20-Year Statute Retrieval Benchmark from 396M Ukrainian Court Citations
di: Ovcharov, Volodymyr
Pubblicazione: (2026)
di: Ovcharov, Volodymyr
Pubblicazione: (2026)
ArcheType: A Novel Framework for Open-Source Column Type Annotation using Large Language Models
di: Feuer, Benjamin, et al.
Pubblicazione: (2023)
di: Feuer, Benjamin, et al.
Pubblicazione: (2023)
Computational-Assisted Systematic Review and Meta-Analysis (CASMA): Effect of a Subclass of GnRH-a on Endometriosis Recurrence
di: Tsang, Sandro
Pubblicazione: (2025)
di: Tsang, Sandro
Pubblicazione: (2025)
Query-Centric Graph Retrieval Augmented Generation
di: Wu, Yaxiong, et al.
Pubblicazione: (2025)
di: Wu, Yaxiong, et al.
Pubblicazione: (2025)
Agentic Retrieval-Augmented Generation for Financial Document Question Answering
di: Shu, Yang, et al.
Pubblicazione: (2026)
di: Shu, Yang, et al.
Pubblicazione: (2026)
Documenti analoghi
-
The Table of Media Bias Elements: A sentence-level taxonomy of media bias types and propaganda techniques
di: Menzner, Tim, et al.
Pubblicazione: (2026) -
Agentic Framework for Political Biography Extraction
di: Zhu, Yifei, et al.
Pubblicazione: (2026) -
ChronoMedKG: A Temporally-Grounded Biomedical Knowledge Graph and Benchmark for Clinical Reasoning
di: Ahmed, Md Shamim, et al.
Pubblicazione: (2026) -
TransResAI: A Compound AI System for Coastal Transportation Resilience
di: Pu, Qingwen, et al.
Pubblicazione: (2026) -
Prompt-RAG: Pioneering Vector Embedding-Free Retrieval-Augmented Generation in Niche Domains, Exemplified by Korean Medicine
di: Kang, Bongsu, et al.
Pubblicazione: (2024)