Do Language Models Think Consistently? A Study of Value Preferences Across Varying Response Lengths
Fuente:
arXiv
Guardado en:
| Autores principales: | Nair, Inderjeet, Wang, Lu |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
MIDGARD: Self-Consistency Using Minimum Description Length for Structured Commonsense Reasoning
por: Nair, Inderjeet, et al.
Publicado: (2024)
por: Nair, Inderjeet, et al.
Publicado: (2024)
Value-Conflict Diagnostics Reveal Widespread Alignment Faking in Language Models
por: Nair, Inderjeet, et al.
Publicado: (2026)
por: Nair, Inderjeet, et al.
Publicado: (2026)
Closing the Loop: Learning to Generate Writing Feedback via Language Model Simulated Student Revisions
por: Nair, Inderjeet, et al.
Publicado: (2024)
por: Nair, Inderjeet, et al.
Publicado: (2024)
Context Over Content: Exposing Evaluation Faking in Automated Judges
por: Gupta, Manan, et al.
Publicado: (2026)
por: Gupta, Manan, et al.
Publicado: (2026)
Do LLMs have Consistent Values?
por: Rozen, Naama, et al.
Publicado: (2024)
por: Rozen, Naama, et al.
Publicado: (2024)
AdapThink: Adaptive Thinking Preferences for Reasoning Language Model
por: Wan, Xu, et al.
Publicado: (2025)
por: Wan, Xu, et al.
Publicado: (2025)
Do Language Models Reason Across Languages?
por: Meng, Yan, et al.
Publicado: (2026)
por: Meng, Yan, et al.
Publicado: (2026)
How Do Language Models Process Ethical Instructions? Deliberation, Consistency, and Other-Recognition Across Four Models
por: Fukui, Hiroki
Publicado: (2026)
por: Fukui, Hiroki
Publicado: (2026)
InftyThink: Breaking the Length Limits of Long-Context Reasoning in Large Language Models
por: Yan, Yuchen, et al.
Publicado: (2025)
por: Yan, Yuchen, et al.
Publicado: (2025)
AdaThink-Med: Medical Adaptive Thinking with Uncertainty-Guided Length Calibration
por: Rui, Shaohao, et al.
Publicado: (2025)
por: Rui, Shaohao, et al.
Publicado: (2025)
CASTILLO: Characterizing Response Length Distributions of Large Language Models
por: Perez-Ramirez, Daniel F., et al.
Publicado: (2025)
por: Perez-Ramirez, Daniel F., et al.
Publicado: (2025)
Preference Consistency Matters: Enhancing Preference Learning in Language Models with Automated Self-Curation of Training Corpora
por: Lee, JoonHo, et al.
Publicado: (2024)
por: Lee, JoonHo, et al.
Publicado: (2024)
Are Large Language Models Consistent over Value-laden Questions?
por: Moore, Jared, et al.
Publicado: (2024)
por: Moore, Jared, et al.
Publicado: (2024)
Do Language Models Track Entities Across State Changes?
por: Tang, Zilu, et al.
Publicado: (2026)
por: Tang, Zilu, et al.
Publicado: (2026)
Cross-Model Consistency of AI-Generated Exercise Prescriptions: A Repeated Generation Study Across Three Large Language Models
por: Lee, Kihyuk
Publicado: (2026)
por: Lee, Kihyuk
Publicado: (2026)
Beyond English-Centric LLMs: What Language Do Multilingual Language Models Think in?
por: Zhong, Chengzhi, et al.
Publicado: (2024)
por: Zhong, Chengzhi, et al.
Publicado: (2024)
Think Again! The Effect of Test-Time Compute on Preferences, Opinions, and Beliefs of Large Language Models
por: Kour, George, et al.
Publicado: (2025)
por: Kour, George, et al.
Publicado: (2025)
How Much Do LLMs Hallucinate in Document Q&A Scenarios? A 172-Billion-Token Study Across Temperatures, Context Lengths, and Hardware Platforms
por: Roig, JV
Publicado: (2026)
por: Roig, JV
Publicado: (2026)
VAL-Bench: Belief Consistency as a measure for Value Alignment in Language Models
por: Gupta, Aman, et al.
Publicado: (2025)
por: Gupta, Aman, et al.
Publicado: (2025)
Do Retrieval-Augmented Language Models Adapt to Varying User Needs?
por: Wu, Peilin, et al.
Publicado: (2025)
por: Wu, Peilin, et al.
Publicado: (2025)
Resonance RoPE: Improving Context Length Generalization of Large Language Models
por: Wang, Suyuchen, et al.
Publicado: (2024)
por: Wang, Suyuchen, et al.
Publicado: (2024)
Aligning Large Language Models with Searcher Preferences
por: Wu, Wei, et al.
Publicado: (2026)
por: Wu, Wei, et al.
Publicado: (2026)
More Thinking, More Bias: Length-Driven Position Bias in Reasoning Models
por: Wang, Xiao
Publicado: (2026)
por: Wang, Xiao
Publicado: (2026)
Can Large Language Models Simulate Human Responses? A Case Study of Stated Preference Experiments in the Context of Heating-related Choices
por: Wang, Han, et al.
Publicado: (2025)
por: Wang, Han, et al.
Publicado: (2025)
When Do Tools and Planning Help Large Language Models Think? A Cost- and Latency-Aware Benchmark
por: Ghoshal, Subha, et al.
Publicado: (2026)
por: Ghoshal, Subha, et al.
Publicado: (2026)
Consistency of Responses and Continuations Generated by Large Language Models on Social Media
por: Xu, Wentao, et al.
Publicado: (2025)
por: Xu, Wentao, et al.
Publicado: (2025)
Thinking Tokens for Language Modeling
por: Herel, David, et al.
Publicado: (2024)
por: Herel, David, et al.
Publicado: (2024)
Iterative Length-Regularized Direct Preference Optimization: A Case Study on Improving 7B Language Models to GPT-4 Level
por: Liu, Jie, et al.
Publicado: (2024)
por: Liu, Jie, et al.
Publicado: (2024)
A Dynamic Fusion Model for Consistent Crisis Response
por: Song, Xiaoying, et al.
Publicado: (2025)
por: Song, Xiaoying, et al.
Publicado: (2025)
Do Thinking Tokens Help or Trap? Towards More Efficient Large Reasoning Model
por: Ding, Bowen, et al.
Publicado: (2025)
por: Ding, Bowen, et al.
Publicado: (2025)
What are Models Thinking about? Understanding Large Language Model Hallucinations "Psychology" through Model Inner State Analysis
por: Wang, Peiran, et al.
Publicado: (2025)
por: Wang, Peiran, et al.
Publicado: (2025)
Cognitive Decision Routing in Large Language Models: When to Think Fast, When to Think Slow
por: Du, Y., et al.
Publicado: (2025)
por: Du, Y., et al.
Publicado: (2025)
Thinking About Thinking: Evaluating Reasoning in Post-Trained Language Models
por: Singla, Pratham, et al.
Publicado: (2025)
por: Singla, Pratham, et al.
Publicado: (2025)
Aligning with Logic: Measuring, Evaluating and Improving Logical Preference Consistency in Large Language Models
por: Liu, Yinhong, et al.
Publicado: (2024)
por: Liu, Yinhong, et al.
Publicado: (2024)
LIFEBench: Evaluating Length Instruction Following in Large Language Models
por: Zhang, Wei, et al.
Publicado: (2025)
por: Zhang, Wei, et al.
Publicado: (2025)
Output Length Effect on DeepSeek-R1's Safety in Forced Thinking
por: Li, Xuying, et al.
Publicado: (2025)
por: Li, Xuying, et al.
Publicado: (2025)
Preference Packing: Efficient Preference Optimization for Large Language Models
por: Cho, Jaekyung
Publicado: (2026)
por: Cho, Jaekyung
Publicado: (2026)
MobileIPL: Enhancing Mobile Agents Thinking Process via Iterative Preference Learning
por: Huang, Kun, et al.
Publicado: (2025)
por: Huang, Kun, et al.
Publicado: (2025)
Deep Value Benchmark: Measuring Whether Models Generalize Deep Values or Shallow Preferences
por: Ashkinaze, Joshua, et al.
Publicado: (2025)
por: Ashkinaze, Joshua, et al.
Publicado: (2025)
Improving Multi-turn Dialogue Consistency with Self-Recall Thinking
por: Pang, Renning, et al.
Publicado: (2026)
por: Pang, Renning, et al.
Publicado: (2026)
Ejemplares similares
-
MIDGARD: Self-Consistency Using Minimum Description Length for Structured Commonsense Reasoning
por: Nair, Inderjeet, et al.
Publicado: (2024) -
Value-Conflict Diagnostics Reveal Widespread Alignment Faking in Language Models
por: Nair, Inderjeet, et al.
Publicado: (2026) -
Closing the Loop: Learning to Generate Writing Feedback via Language Model Simulated Student Revisions
por: Nair, Inderjeet, et al.
Publicado: (2024) -
Context Over Content: Exposing Evaluation Faking in Automated Judges
por: Gupta, Manan, et al.
Publicado: (2026) -
Do LLMs have Consistent Values?
por: Rozen, Naama, et al.
Publicado: (2024)