Same Content, Different Representations: A Controlled Study for Table QA
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Zhang, Yue, Maekawa, Seiji, Bhutani, Nikita |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Efficient Context Selection for Long-Context QA: No Tuning, No Iteration, Just Adaptive-$k$
par: Taguchi, Chihiro, et autres
Publié: (2025)
par: Taguchi, Chihiro, et autres
Publié: (2025)
The Rarity Blind Spot: A Framework for Evaluating Statistical Reasoning in LLMs
par: Maekawa, Seiji, et autres
Publié: (2025)
par: Maekawa, Seiji, et autres
Publié: (2025)
Holistic Reasoning with Long-Context LMs: A Benchmark for Database Operations on Massive Textual Data
par: Maekawa, Seiji, et autres
Publié: (2024)
par: Maekawa, Seiji, et autres
Publié: (2024)
Retrieval Helps or Hurts? A Deeper Dive into the Efficacy of Retrieval Augmentation to Language Models
par: Maekawa, Seiji, et autres
Publié: (2024)
par: Maekawa, Seiji, et autres
Publié: (2024)
From Single to Multi: How LLMs Hallucinate in Multi-Document Summarization
par: Belem, Catarina G., et autres
Publié: (2024)
par: Belem, Catarina G., et autres
Publié: (2024)
Natural Language Processing for Human Resources: A Survey
par: Otani, Naoki, et autres
Publié: (2024)
par: Otani, Naoki, et autres
Publié: (2024)
XATU: A Fine-grained Instruction-based Benchmark for Explainable Text Updates
par: Zhang, Haopeng, et autres
Publié: (2023)
par: Zhang, Haopeng, et autres
Publié: (2023)
Towards Reliable Benchmarking: A Contamination Free, Controllable Evaluation Framework for Multi-step LLM Function Calling
par: Maekawa, Seiji, et autres
Publié: (2025)
par: Maekawa, Seiji, et autres
Publié: (2025)
OmniTQA: A Cost-Aware System for Hybrid Query Processing over Semi-Structured Data
par: Shahbazi, Nima, et autres
Publié: (2026)
par: Shahbazi, Nima, et autres
Publié: (2026)
Evaluating Bias in LLMs for Job-Resume Matching: Gender, Race, and Education
par: Iso, Hayate, et autres
Publié: (2025)
par: Iso, Hayate, et autres
Publié: (2025)
Risks and NLP Design: A Case Study on Procedural Document QA
par: Haduong, Nikita, et autres
Publié: (2024)
par: Haduong, Nikita, et autres
Publié: (2024)
Do Agents Need to Plan Step-by-Step? Rethinking Planning Horizon in Data-Centric Tool Calling
par: Otani, Naoki, et autres
Publié: (2026)
par: Otani, Naoki, et autres
Publié: (2026)
Align then Train: Efficient Retrieval Adapter Learning
par: Maekawa, Seiji, et autres
Publié: (2026)
par: Maekawa, Seiji, et autres
Publié: (2026)
Less is More for Long Document Summary Evaluation by LLMs
par: Wu, Yunshu, et autres
Publié: (2023)
par: Wu, Yunshu, et autres
Publié: (2023)
Same Input, Different Scores: A Multi Model Study on the Inconsistency of LLM Judge
par: Lau, Fiona
Publié: (2026)
par: Lau, Fiona
Publié: (2026)
The Same But Different: Structural Similarities and Differences in Multilingual Language Modeling
par: Zhang, Ruochen, et autres
Publié: (2024)
par: Zhang, Ruochen, et autres
Publié: (2024)
RJUA-QA: A Comprehensive QA Dataset for Urology
par: Lyu, Shiwei, et autres
Publié: (2023)
par: Lyu, Shiwei, et autres
Publié: (2023)
Rethinking Atomic Decomposition for LLM Judges: A Prompt-Controlled Study of Reference-Grounded QA Evaluation
par: Zhang, Xinran
Publié: (2026)
par: Zhang, Xinran
Publié: (2026)
More of the Same: Persistent Representational Harms Under Increased Representation
par: Mickel, Jennifer, et autres
Publié: (2025)
par: Mickel, Jennifer, et autres
Publié: (2025)
DeCode: Decoupling Content and Delivery for Medical QA
par: Ko, Po-Jen, et autres
Publié: (2026)
par: Ko, Po-Jen, et autres
Publié: (2026)
Reasoning Capacity in Multi-Agent Systems: Limitations, Challenges and Human-Centered Solutions
par: Pezeshkpour, Pouya, et autres
Publié: (2024)
par: Pezeshkpour, Pouya, et autres
Publié: (2024)
KET-QA: A Dataset for Knowledge Enhanced Table Question Answering
par: Hu, Mengkang, et autres
Publié: (2024)
par: Hu, Mengkang, et autres
Publié: (2024)
Personalized LLM for Generating Customized Responses to the Same Query from Different Users
par: Zeng, Hang, et autres
Publié: (2024)
par: Zeng, Hang, et autres
Publié: (2024)
AmbigDocs: Reasoning across Documents on Different Entities under the Same Name
par: Lee, Yoonsang, et autres
Publié: (2024)
par: Lee, Yoonsang, et autres
Publié: (2024)
Cofca: A Step-Wise Counterfactual Multi-hop QA benchmark
par: Wu, Jian, et autres
Publié: (2024)
par: Wu, Jian, et autres
Publié: (2024)
Same Patient, Different Words, Different Diagnosis? Evaluating Semantic Stability in Clinical LLMs
par: Alkaeed, Mahdi, et autres
Publié: (2026)
par: Alkaeed, Mahdi, et autres
Publié: (2026)
How Robust are the Tabular QA Models for Scientific Tables? A Study using Customized Dataset
par: Ghosh, Akash, et autres
Publié: (2024)
par: Ghosh, Akash, et autres
Publié: (2024)
EEE-QA: Exploring Effective and Efficient Question-Answer Representations
par: Hu, Zhanghao, et autres
Publié: (2024)
par: Hu, Zhanghao, et autres
Publié: (2024)
Structured Chain-of-Thought Prompting for Few-Shot Generation of Content-Grounded QA Conversations
par: Sultan, Md Arafat, et autres
Publié: (2024)
par: Sultan, Md Arafat, et autres
Publié: (2024)
ExpertGenQA: Open-ended QA generation in Specialized Domains
par: Shahgir, Haz Sameen, et autres
Publié: (2025)
par: Shahgir, Haz Sameen, et autres
Publié: (2025)
Same Meaning, Different Scores: Lexical and Syntactic Sensitivity in LLM Evaluation
par: Kostić, Bogdan, et autres
Publié: (2026)
par: Kostić, Bogdan, et autres
Publié: (2026)
Same Claim, Different Judgment: Benchmarking Scenario-Induced Bias in Multilingual Financial Misinformation Detection
par: Liu, Zhiwei, et autres
Publié: (2026)
par: Liu, Zhiwei, et autres
Publié: (2026)
SEC-QA: A Systematic Evaluation Corpus for Financial QA
par: Lai, Viet Dac, et autres
Publié: (2024)
par: Lai, Viet Dac, et autres
Publié: (2024)
Same Company, Same Signal: The Role of Identity in Earnings Call Transcripts
par: Yu, Ding, et autres
Publié: (2024)
par: Yu, Ding, et autres
Publié: (2024)
Will It Still Be True Tomorrow? Multilingual Evergreen Question Classification to Improve Trustworthy QA
par: Pletenev, Sergey, et autres
Publié: (2025)
par: Pletenev, Sergey, et autres
Publié: (2025)
Same Model, Different Weakness: How Language and Modality Reshape the Jailbreak Attack Surface in Frontier MLLMs
par: Ford, Casey, et autres
Publié: (2026)
par: Ford, Casey, et autres
Publié: (2026)
Same Evidence, Different Answers: Canonical-Context On-Policy Distillation for Multi-Turn Language Models
par: Lin, Zizhuo, et autres
Publié: (2026)
par: Lin, Zizhuo, et autres
Publié: (2026)
Same Question, Different Words: A Latent Adversarial Framework for Prompt Robustness
par: Fu, Tingchen, et autres
Publié: (2025)
par: Fu, Tingchen, et autres
Publié: (2025)
RepLiQA: A Question-Answering Dataset for Benchmarking LLMs on Unseen Reference Content
par: Monteiro, Joao, et autres
Publié: (2024)
par: Monteiro, Joao, et autres
Publié: (2024)
DeepSearchQA: Bridging the Comprehensiveness Gap for Deep Research Agents
par: Gupta, Nikita, et autres
Publié: (2026)
par: Gupta, Nikita, et autres
Publié: (2026)
Documents similaires
-
Efficient Context Selection for Long-Context QA: No Tuning, No Iteration, Just Adaptive-$k$
par: Taguchi, Chihiro, et autres
Publié: (2025) -
The Rarity Blind Spot: A Framework for Evaluating Statistical Reasoning in LLMs
par: Maekawa, Seiji, et autres
Publié: (2025) -
Holistic Reasoning with Long-Context LMs: A Benchmark for Database Operations on Massive Textual Data
par: Maekawa, Seiji, et autres
Publié: (2024) -
Retrieval Helps or Hurts? A Deeper Dive into the Efficacy of Retrieval Augmentation to Language Models
par: Maekawa, Seiji, et autres
Publié: (2024) -
From Single to Multi: How LLMs Hallucinate in Multi-Document Summarization
par: Belem, Catarina G., et autres
Publié: (2024)