Large Language Models Badly Generalize across Option Length, Problem Types, and Irrelevant Noun Replacements
Fuente:
arXiv
Guardado en:
| Autores principales: | Zhao, Guangxiang, Hu, Saier, Jian, Xiaoqi, Wu, Jinzhu, Wu, Yuhan, Jia, Change, Sun, Lin, Zhang, Xiangzheng |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Evaluation is All You Need: Strategic Overclaiming of LLM Reasoning Capabilities Through Evaluation Design
por: Sun, Lin, et al.
Publicado: (2025)
por: Sun, Lin, et al.
Publicado: (2025)
TinyR1-32B-Preview: Boosting Accuracy with Branch-Merge Distillation
por: Sun, Lin, et al.
Publicado: (2025)
por: Sun, Lin, et al.
Publicado: (2025)
Uncertainty Under the Curve: A Sequence-Level Entropy Area Metric for Reasoning LLM
por: Zhu, Yongfu, et al.
Publicado: (2025)
por: Zhu, Yongfu, et al.
Publicado: (2025)
When Good OCR Is Not Enough: Benchmarking OCR Robustness for Retrieval-Augmented Generation
por: Sun, Lin, et al.
Publicado: (2026)
por: Sun, Lin, et al.
Publicado: (2026)
Router Upcycling: Leveraging Mixture-of-Routers in Mixture-of-Experts Upcycling
por: Ran, Junfeng, et al.
Publicado: (2025)
por: Ran, Junfeng, et al.
Publicado: (2025)
BEAR: Budgeted Evidence Allocation for Multi-Document Reasoning
por: Sun, Lin, et al.
Publicado: (2026)
por: Sun, Lin, et al.
Publicado: (2026)
A Primer in Post-Training Reasoning Data: What We Know About How It Works
por: Li, Yaoming, et al.
Publicado: (2026)
por: Li, Yaoming, et al.
Publicado: (2026)
Thinking with Reasoning Skills: Fewer Tokens, More Accuracy
por: Zhao, Guangxiang, et al.
Publicado: (2026)
por: Zhao, Guangxiang, et al.
Publicado: (2026)
How Easily do Irrelevant Inputs Skew the Responses of Large Language Models?
por: Wu, Siye, et al.
Publicado: (2024)
por: Wu, Siye, et al.
Publicado: (2024)
Instructing Large Language Models to Identify and Ignore Irrelevant Conditions
por: Wu, Zhenyu, et al.
Publicado: (2024)
por: Wu, Zhenyu, et al.
Publicado: (2024)
The Politics of Bad Options
por: Walter, Stefanie, et al.
Publicado: (2023)
por: Walter, Stefanie, et al.
Publicado: (2023)
Chain-of-Thought Matters: Improving Long-Context Language Models with Reasoning Path Supervision
por: Zhu, Dawei, et al.
Publicado: (2025)
por: Zhu, Dawei, et al.
Publicado: (2025)
Study on Hilbert's Eighth Problems
por: Han, Jinzhu
Publicado: (2007)
por: Han, Jinzhu
Publicado: (2007)
Harness-Bench: Measuring Harness Effects across Models in Realistic Agent Workflows
por: Yao, Yilun, et al.
Publicado: (2026)
por: Yao, Yilun, et al.
Publicado: (2026)
Beyond Parameter Arithmetic: Sparse Complementary Fusion for Distribution-Aware Model Merging
por: Lin, Weihong, et al.
Publicado: (2026)
por: Lin, Weihong, et al.
Publicado: (2026)
Irrelevant Alternatives Bias Large Language Model Hiring Decisions
por: Valkanova, Kremena, et al.
Publicado: (2024)
por: Valkanova, Kremena, et al.
Publicado: (2024)
Characterising Toxicity in Generative Large Language Models
por: Zhang, Zhiyao, et al.
Publicado: (2026)
por: Zhang, Zhiyao, et al.
Publicado: (2026)
The Arabic Noun System Generation
por: Soudi, Abdelhadi, et al.
Publicado: (2024)
por: Soudi, Abdelhadi, et al.
Publicado: (2024)
When Silence Matters: The Impact of Irrelevant Audio on Text Reasoning in Large Audio-Language Models
por: Li, Chen-An, et al.
Publicado: (2025)
por: Li, Chen-An, et al.
Publicado: (2025)
Options for Replacing and Reformatting Deteriorated Materials.
por: Banks, Jennifer
Publicado: (1993)
por: Banks, Jennifer
Publicado: (1993)
MEAT: Multiview Diffusion Model for Human Generation on Megapixels with Mesh Attention
por: Wang, Yuhan, et al.
Publicado: (2025)
por: Wang, Yuhan, et al.
Publicado: (2025)
Hypothesis Testing for Progressive Kernel Estimation and VCM Framework
por: Lin, Zehui, et al.
Publicado: (2025)
por: Lin, Zehui, et al.
Publicado: (2025)
Syntax of Dutch: Nouns and Noun Phrases - Volume 1
por: Broekhuis, Hans, et al.
Publicado: (2025)
por: Broekhuis, Hans, et al.
Publicado: (2025)
Syntax of Dutch: Nouns and Noun Phrases - Volume 2
por: Broekhuis, Hans, et al.
Publicado: (2025)
por: Broekhuis, Hans, et al.
Publicado: (2025)
A remark on $Λ^2$-enlargeable manifolds
por: Su, Guangxiang
Publicado: (2025)
por: Su, Guangxiang
Publicado: (2025)
Improving Variable-Length Generation in Diffusion Language Models via Length Regularization
por: Cheng, Zicong, et al.
Publicado: (2026)
por: Cheng, Zicong, et al.
Publicado: (2026)
The Free Option Problem of ePBS
por: Mazorra, Bruno, et al.
Publicado: (2025)
por: Mazorra, Bruno, et al.
Publicado: (2025)
ELEC: Efficient Large Language Model-Empowered Click-Through Rate Prediction
por: Dong, Rui, et al.
Publicado: (2025)
por: Dong, Rui, et al.
Publicado: (2025)
GCoder: Improving Large Language Model for Generalized Graph Problem Solving
por: Zhang, Qifan, et al.
Publicado: (2024)
por: Zhang, Qifan, et al.
Publicado: (2024)
A Globalized Semismooth Newton Method for Prox-regular Optimization Problems
por: Wu, Yuqia, et al.
Publicado: (2025)
por: Wu, Yuqia, et al.
Publicado: (2025)
BadRAG: Identifying Vulnerabilities in Retrieval Augmented Generation of Large Language Models
por: Xue, Jiaqi, et al.
Publicado: (2024)
por: Xue, Jiaqi, et al.
Publicado: (2024)
Analysis of Noun-Noun sequences: a rule based approach
por: Jose Mari Arriola
Publicado: (2008)
por: Jose Mari Arriola
Publicado: (2008)
Enhancing Robustness in Large Language Models: Prompting for Mitigating the Impact of Irrelevant Information
por: Jiang, Ming, et al.
Publicado: (2024)
por: Jiang, Ming, et al.
Publicado: (2024)
Exploring Large Language Models for Word Games:Who is the Spy?
por: Wei, Chentian, et al.
Publicado: (2025)
por: Wei, Chentian, et al.
Publicado: (2025)
Pricing VIX Futures and Options With Good and Bad Volatility of Volatility
por: Zhiyu Guo, et al.
Publicado: (2024)
por: Zhiyu Guo, et al.
Publicado: (2024)
Are Language Models Sensitive to Morally Irrelevant Distractors?
por: Shaw, Andrew, et al.
Publicado: (2026)
por: Shaw, Andrew, et al.
Publicado: (2026)
RAC: Relation-Aware Cache Replacement for Large Language Models
por: Wu, Yuchong, et al.
Publicado: (2026)
por: Wu, Yuchong, et al.
Publicado: (2026)
PIP: Detecting Adversarial Examples in Large Vision-Language Models via Attention Patterns of Irrelevant Probe Questions
por: Zhang, Yudong, et al.
Publicado: (2024)
por: Zhang, Yudong, et al.
Publicado: (2024)
Food Image Generation on Multi-Noun Categories
por: Pan, Xinyue, et al.
Publicado: (2025)
por: Pan, Xinyue, et al.
Publicado: (2025)
Unrestricted Error-Type Codebook Generation for Error Correction Code in DNA Storage Inspired by NLP
por: Lu, Yi, et al.
Publicado: (2024)
por: Lu, Yi, et al.
Publicado: (2024)
Ejemplares similares
-
Evaluation is All You Need: Strategic Overclaiming of LLM Reasoning Capabilities Through Evaluation Design
por: Sun, Lin, et al.
Publicado: (2025) -
TinyR1-32B-Preview: Boosting Accuracy with Branch-Merge Distillation
por: Sun, Lin, et al.
Publicado: (2025) -
Uncertainty Under the Curve: A Sequence-Level Entropy Area Metric for Reasoning LLM
por: Zhu, Yongfu, et al.
Publicado: (2025) -
When Good OCR Is Not Enough: Benchmarking OCR Robustness for Retrieval-Augmented Generation
por: Sun, Lin, et al.
Publicado: (2026) -
Router Upcycling: Leveraging Mixture-of-Routers in Mixture-of-Experts Upcycling
por: Ran, Junfeng, et al.
Publicado: (2025)