Enregistré dans:
| Auteurs principaux: | Kulkarni, Shubham, Lyzhov, Alexander, Joshi, Preetam, Chaitanya, Shiva |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | https://arxiv.org/abs/2602.18448 |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
All Required, In Order: Phase-Level Evaluation for AI-Human Dialogue in Healthcare and Beyond
par: Kulkarni, Shubham, et autres
Publié: (2026)
par: Kulkarni, Shubham, et autres
Publié: (2026)
HalluciNot: Hallucination Detection Through Context and Common Knowledge Verification
par: Paudel, Bibek, et autres
Publié: (2025)
par: Paudel, Bibek, et autres
Publié: (2025)
ClaimDB: A Fact Verification Benchmark over Large Structured Data
par: Theologitis, Michael, et autres
Publié: (2026)
par: Theologitis, Michael, et autres
Publié: (2026)
ComperDial: Commonsense Persona-grounded Dialogue Dataset and Benchmark
par: Wakaki, Hiromi, et autres
Publié: (2024)
par: Wakaki, Hiromi, et autres
Publié: (2024)
QAM-W: Joint 2D Codebook Quantization for LLM Weights via Hadamard Rotation and Activation-Aware Scaling
par: Sharma, Preetam, et autres
Publié: (2026)
par: Sharma, Preetam, et autres
Publié: (2026)
FineDialFact: A benchmark for Fine-grained Dialogue Fact Verification
par: Chen, Xiangyan, et autres
Publié: (2025)
par: Chen, Xiangyan, et autres
Publié: (2025)
L3Cube-MahaSum: A Comprehensive Dataset and BART Models for Abstractive Text Summarization in Marathi
par: Deshmukh, Pranita, et autres
Publié: (2024)
par: Deshmukh, Pranita, et autres
Publié: (2024)
Steering Without Side Effects: Improving Post-Deployment Control of Language Models
par: Stickland, Asa Cooper, et autres
Publié: (2024)
par: Stickland, Asa Cooper, et autres
Publié: (2024)
Dial HEALTHDIAL for Advice: A Multilingual and Multi-Parallel Spoken Dialogue Dataset for Knowledge-Grounded Information Seeking
par: Hu, Songbo, et autres
Publié: (2026)
par: Hu, Songbo, et autres
Publié: (2026)
Dynamic-KGQA: A Scalable Framework for Generating Adaptive Question Answering Datasets
par: Dammu, Preetam Prabhu Srikar, et autres
Publié: (2025)
par: Dammu, Preetam Prabhu Srikar, et autres
Publié: (2025)
UniDial-EvalKit: A Unified Toolkit for Evaluating Multi-Faceted Conversational Abilities
par: Jia, Qi, et autres
Publié: (2026)
par: Jia, Qi, et autres
Publié: (2026)
DialDefer: A Framework for Detecting and Mitigating LLM Dialogic Deference
par: Rabbani, Parisa, et autres
Publié: (2026)
par: Rabbani, Parisa, et autres
Publié: (2026)
HalluDial: A Large-Scale Benchmark for Automatic Dialogue-Level Hallucination Evaluation
par: Luo, Wen, et autres
Publié: (2024)
par: Luo, Wen, et autres
Publié: (2024)
IndicSQuAD: A Comprehensive Multilingual Question Answering Dataset for Indic Languages
par: Endait, Sharvi, et autres
Publié: (2025)
par: Endait, Sharvi, et autres
Publié: (2025)
EmoBench-UA: A Benchmark Dataset for Emotion Detection in Ukrainian
par: Dementieva, Daryna, et autres
Publié: (2025)
par: Dementieva, Daryna, et autres
Publié: (2025)
Culturally-Aware Conversations: A Framework & Benchmark for LLMs
par: Havaldar, Shreya, et autres
Publié: (2025)
par: Havaldar, Shreya, et autres
Publié: (2025)
SPACER: A Parallel Dataset of Speech Production And Comprehension of Error Repairs
par: Upadhye, Shiva, et autres
Publié: (2025)
par: Upadhye, Shiva, et autres
Publié: (2025)
CliniDial: A Naturally Occurring Multimodal Dialogue Dataset for Team Reflection in Action During Clinical Operation
par: Deng, Naihao, et autres
Publié: (2025)
par: Deng, Naihao, et autres
Publié: (2025)
Flattery, Fluff, and Fog: Diagnosing and Mitigating Idiosyncratic Biases in Preference Models
par: Bharadwaj, Anirudh, et autres
Publié: (2025)
par: Bharadwaj, Anirudh, et autres
Publié: (2025)
Toward Reliable Clinical Coding with Language Models: Verification and Lightweight Adaptation
par: Yuan, Zhangdie, et autres
Publié: (2025)
par: Yuan, Zhangdie, et autres
Publié: (2025)
"They are uncultured": Unveiling Covert Harms and Social Threats in LLM Generated Conversations
par: Dammu, Preetam Prabhu Srikar, et autres
Publié: (2024)
par: Dammu, Preetam Prabhu Srikar, et autres
Publié: (2024)
CompliBench: Benchmarking LLM Judges for Compliance Violation Detection in Dialogue Systems
par: Yang, Jingbo, et autres
Publié: (2026)
par: Yang, Jingbo, et autres
Publié: (2026)
DialSim: A Dialogue Simulator for Evaluating Long-Term Multi-Party Dialogue Understanding of Conversational Agents
par: Kim, Jiho, et autres
Publié: (2024)
par: Kim, Jiho, et autres
Publié: (2024)
Topic-Conversation Relevance (TCR) Dataset and Benchmarks
par: Fan, Yaran, et autres
Publié: (2024)
par: Fan, Yaran, et autres
Publié: (2024)
The 2nd FutureDial Challenge: Dialog Systems with Retrieval Augmented Generation (FutureDial-RAG)
par: Cai, Yucheng, et autres
Publié: (2024)
par: Cai, Yucheng, et autres
Publié: (2024)
Pragyaan: Designing and Curating High-Quality Cultural Post-Training Datasets for Indian Languages
par: Rachamalla, Neel Prabhanjan, et autres
Publié: (2025)
par: Rachamalla, Neel Prabhanjan, et autres
Publié: (2025)
ClaimVer: Explainable Claim-Level Verification and Evidence Attribution of Text Through Knowledge Graphs
par: Dammu, Preetam Prabhu Srikar, et autres
Publié: (2024)
par: Dammu, Preetam Prabhu Srikar, et autres
Publié: (2024)
OmniCompliance-100K: A Multi-Domain, Rule-Grounded, Real-World Safety Compliance Dataset
par: Hu, Wenbin, et autres
Publié: (2026)
par: Hu, Wenbin, et autres
Publié: (2026)
MedDialBench: Benchmarking LLM Diagnostic Robustness under Parametric Adversarial Patient Behaviors
par: Luo, Xiaotian, et autres
Publié: (2026)
par: Luo, Xiaotian, et autres
Publié: (2026)
Leveraging Parameter Efficient Training Methods for Low Resource Text Classification: A Case Study in Marathi
par: Deshmukh, Pranita, et autres
Publié: (2024)
par: Deshmukh, Pranita, et autres
Publié: (2024)
Afrispeech-Dialog: A Benchmark Dataset for Spontaneous English Conversations in Healthcare and Beyond
par: Sanni, Mardhiyah, et autres
Publié: (2025)
par: Sanni, Mardhiyah, et autres
Publié: (2025)
A Challenge Dataset and Effective Models for Conversational Stance Detection
par: Niu, Fuqiang, et autres
Publié: (2024)
par: Niu, Fuqiang, et autres
Publié: (2024)
MUTANT: A Recipe for Multilingual Tokenizer Design
par: Rana, Souvik, et autres
Publié: (2025)
par: Rana, Souvik, et autres
Publié: (2025)
CA-BED: Conversation-Aware Bayesian Experimental Design
par: Arnould, Daniel, et autres
Publié: (2026)
par: Arnould, Daniel, et autres
Publié: (2026)
Speaker Verification in Agent-Generated Conversations
par: Yang, Yizhe, et autres
Publié: (2024)
par: Yang, Yizhe, et autres
Publié: (2024)
Memory Dial: A Training Framework for Controllable Memorization in Language Models
par: Zhang, Xiangbo, et autres
Publié: (2026)
par: Zhang, Xiangbo, et autres
Publié: (2026)
iAgentBench: Benchmarking Sensemaking Capabilities of Information-Seeking Agents on High-Traffic Topics
par: Dammu, Preetam Prabhu Srikar, et autres
Publié: (2026)
par: Dammu, Preetam Prabhu Srikar, et autres
Publié: (2026)
Emotion and Intent Joint Understanding in Multimodal Conversation: A Benchmarking Dataset
par: Liu, Rui, et autres
Publié: (2024)
par: Liu, Rui, et autres
Publié: (2024)
ConvApparel: A Benchmark Dataset and Validation Framework for User Simulators in Conversational Recommenders
par: Meshi, Ofer, et autres
Publié: (2026)
par: Meshi, Ofer, et autres
Publié: (2026)
IndiBias: A Benchmark Dataset to Measure Social Biases in Language Models for Indian Context
par: Sahoo, Nihar Ranjan, et autres
Publié: (2024)
par: Sahoo, Nihar Ranjan, et autres
Publié: (2024)
Documents similaires
-
All Required, In Order: Phase-Level Evaluation for AI-Human Dialogue in Healthcare and Beyond
par: Kulkarni, Shubham, et autres
Publié: (2026) -
HalluciNot: Hallucination Detection Through Context and Common Knowledge Verification
par: Paudel, Bibek, et autres
Publié: (2025) -
ClaimDB: A Fact Verification Benchmark over Large Structured Data
par: Theologitis, Michael, et autres
Publié: (2026) -
ComperDial: Commonsense Persona-grounded Dialogue Dataset and Benchmark
par: Wakaki, Hiromi, et autres
Publié: (2024) -
QAM-W: Joint 2D Codebook Quantization for LLM Weights via Hadamard Rotation and Activation-Aware Scaling
par: Sharma, Preetam, et autres
Publié: (2026)