Evaluating Temporal Consistency in Multi-Turn Language Models
Fuente:
arXiv
Saved in:
| Main Authors: | Atri, Yash Kumar, Johnson, Steven L., Hartvigsen, Tom |
|---|---|
| Format: | Preprint |
| Published: |
2026
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Continually Self-Improving Language Models for Bariatric Surgery Question--Answering
by: Atri, Yash Kumar, et al.
Published: (2025)
by: Atri, Yash Kumar, et al.
Published: (2025)
Model Editing with Graph-Based External Memory
by: Atri, Yash Kumar, et al.
Published: (2025)
by: Atri, Yash Kumar, et al.
Published: (2025)
TAXI: Evaluating Categorical Knowledge Editing for Language Models
by: Powell, Derek, et al.
Published: (2024)
by: Powell, Derek, et al.
Published: (2024)
Evaluating Consistency and Reasoning Capabilities of Large Language Models
by: Saxena, Yash, et al.
Published: (2024)
by: Saxena, Yash, et al.
Published: (2024)
Decoding the Rule Book: Extracting Hidden Moderation Criteria from Reddit Communities
by: Kim, Youngwoo, et al.
Published: (2025)
by: Kim, Youngwoo, et al.
Published: (2025)
PolygloToxicityPrompts: Multilingual Evaluation of Neural Toxic Degeneration in Large Language Models
by: Jain, Devansh, et al.
Published: (2024)
by: Jain, Devansh, et al.
Published: (2024)
ConsistentChat: Building Skeleton-Guided Consistent Multi-Turn Dialogues for Large Language Models from Scratch
by: Chen, Jiawei, et al.
Published: (2025)
by: Chen, Jiawei, et al.
Published: (2025)
Language Models Still Struggle to Zero-shot Reason about Time Series
by: Merrill, Mike A., et al.
Published: (2024)
by: Merrill, Mike A., et al.
Published: (2024)
TurnBench-MS: A Benchmark for Evaluating Multi-Turn, Multi-Step Reasoning in Large Language Models
by: Zhang, Yiran, et al.
Published: (2025)
by: Zhang, Yiran, et al.
Published: (2025)
PICon: A Multi-Turn Interrogation Framework for Evaluating Persona Agent Consistency
by: Kim, Minseo, et al.
Published: (2026)
by: Kim, Minseo, et al.
Published: (2026)
CaT-BENCH: Benchmarking Language Model Understanding of Causal and Temporal Dependencies in Plans
by: Lal, Yash Kumar, et al.
Published: (2024)
by: Lal, Yash Kumar, et al.
Published: (2024)
Consistency of Large Reasoning Models Under Multi-Turn Attacks
by: Li, Yubo, et al.
Published: (2026)
by: Li, Yubo, et al.
Published: (2026)
MT-Eval: A Multi-Turn Capabilities Evaluation Benchmark for Large Language Models
by: Kwan, Wai-Chung, et al.
Published: (2024)
by: Kwan, Wai-Chung, et al.
Published: (2024)
Can Language Models Identify Side Effects of Breast Cancer Radiation Treatments?
by: Seah, Natalie, et al.
Published: (2026)
by: Seah, Natalie, et al.
Published: (2026)
TRUTH DECAY: Quantifying Multi-Turn Sycophancy in Language Models
by: Liu, Joshua, et al.
Published: (2025)
by: Liu, Joshua, et al.
Published: (2025)
Modeling and Predicting Multi-Turn Answer Instability in Large Language Models
by: He, Jiahang, et al.
Published: (2025)
by: He, Jiahang, et al.
Published: (2025)
Consistently Simulating Human Personas with Multi-Turn Reinforcement Learning
by: Abdulhai, Marwa, et al.
Published: (2025)
by: Abdulhai, Marwa, et al.
Published: (2025)
CoSafe: Evaluating Large Language Model Safety in Multi-Turn Dialogue Coreference
by: Yu, Erxin, et al.
Published: (2024)
by: Yu, Erxin, et al.
Published: (2024)
DCR-Consistency: Divide-Conquer-Reasoning for Consistency Evaluation and Improvement of Large Language Models
by: Cui, Wendi, et al.
Published: (2024)
by: Cui, Wendi, et al.
Published: (2024)
Beyond Single-Turn: A Survey on Multi-Turn Interactions with Large Language Models
by: Li, Yubo, et al.
Published: (2025)
by: Li, Yubo, et al.
Published: (2025)
Temporally Consistent Factuality Probing for Large Language Models
by: Bajpai, Ashutosh, et al.
Published: (2024)
by: Bajpai, Ashutosh, et al.
Published: (2024)
Labeling Free-text Data using Language Model Ensembles
by: Qiu, Jiaxing, et al.
Published: (2025)
by: Qiu, Jiaxing, et al.
Published: (2025)
ISO-Bench: Benchmarking Multimodal Causal Reasoning in Visual-Language Models through Procedural Plans
by: Sadana, Ananya, et al.
Published: (2025)
by: Sadana, Ananya, et al.
Published: (2025)
A Survey on Multi-Turn Interaction Capabilities of Large Language Models
by: Zhang, Chen, et al.
Published: (2025)
by: Zhang, Chen, et al.
Published: (2025)
Parrot: Enhancing Multi-Turn Instruction Following for Large Language Models
by: Sun, Yuchong, et al.
Published: (2023)
by: Sun, Yuchong, et al.
Published: (2023)
ChartEditBench: Evaluating Grounded Multi-Turn Chart Editing in Multimodal Language Models
by: Kapadnis, Manav Nitin, et al.
Published: (2026)
by: Kapadnis, Manav Nitin, et al.
Published: (2026)
MTMCS-Bench: Evaluating Contextual Safety of Multimodal Large Language Models in Multi-Turn Dialogues
by: Liu, Zheyuan, et al.
Published: (2026)
by: Liu, Zheyuan, et al.
Published: (2026)
Evaluating Large Language Models for Material Selection
by: Grandi, Daniele, et al.
Published: (2024)
by: Grandi, Daniele, et al.
Published: (2024)
Evaluating Performance Drift from Model Switching in Multi-Turn LLM Systems
by: Khraishi, Raad, et al.
Published: (2026)
by: Khraishi, Raad, et al.
Published: (2026)
When2Speak: A Dataset for Temporal Participation and Turn-Taking in Multi-Party Conversations for Large Language Models
by: Nama, Vihaan, et al.
Published: (2026)
by: Nama, Vihaan, et al.
Published: (2026)
Temporal Graph Network: Hallucination Detection in Multi-Turn Conversation
by: Rathore, Vidhi, et al.
Published: (2026)
by: Rathore, Vidhi, et al.
Published: (2026)
Math Neurosurgery: Isolating Language Models' Math Reasoning Abilities Using Only Forward Passes
by: Christ, Bryan R., et al.
Published: (2024)
by: Christ, Bryan R., et al.
Published: (2024)
Quantifying Conversational Reliability of Large Language Models under Multi-Turn Interaction
by: Myung, Jiyoon
Published: (2026)
by: Myung, Jiyoon
Published: (2026)
What Makes Large Language Models Reason in (Multi-Turn) Code Generation?
by: Zheng, Kunhao, et al.
Published: (2024)
by: Zheng, Kunhao, et al.
Published: (2024)
Harnessing Temporal Databases for Systematic Evaluation of Factual Time-Sensitive Question-Answering in Large Language Models
by: Kim, Soyeon, et al.
Published: (2025)
by: Kim, Soyeon, et al.
Published: (2025)
PolyGuard: A Multilingual Safety Moderation Tool for 17 Languages
by: Kumar, Priyanshu, et al.
Published: (2025)
by: Kumar, Priyanshu, et al.
Published: (2025)
ArCHer: Training Language Model Agents via Hierarchical Multi-Turn RL
by: Zhou, Yifei, et al.
Published: (2024)
by: Zhou, Yifei, et al.
Published: (2024)
WikiBigEdit: Understanding the Limits of Lifelong Knowledge Editing in LLMs
by: Thede, Lukas, et al.
Published: (2025)
by: Thede, Lukas, et al.
Published: (2025)
Identifying Implicit Social Biases in Vision-Language Models
by: Hamidieh, Kimia, et al.
Published: (2024)
by: Hamidieh, Kimia, et al.
Published: (2024)
Counterfactual-Consistency Prompting for Relative Temporal Understanding in Large Language Models
by: Kim, Jongho, et al.
Published: (2025)
by: Kim, Jongho, et al.
Published: (2025)
Similar Items
-
Continually Self-Improving Language Models for Bariatric Surgery Question--Answering
by: Atri, Yash Kumar, et al.
Published: (2025) -
Model Editing with Graph-Based External Memory
by: Atri, Yash Kumar, et al.
Published: (2025) -
TAXI: Evaluating Categorical Knowledge Editing for Language Models
by: Powell, Derek, et al.
Published: (2024) -
Evaluating Consistency and Reasoning Capabilities of Large Language Models
by: Saxena, Yash, et al.
Published: (2024) -
Decoding the Rule Book: Extracting Hidden Moderation Criteria from Reddit Communities
by: Kim, Youngwoo, et al.
Published: (2025)