A Peek into Token Bias: Large Language Models Are Not Yet Genuine Reasoners
Fuente:
arXiv
Guardado en:
| Autores principales: | Jiang, Bowen, Xie, Yangxinyu, Hao, Zhuoqun, Wang, Xiaomeng, Mallick, Tanwi, Su, Weijie J., Taylor, Camillo J., Roth, Dan |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Towards Rationality in Language and Multimodal Agents: A Survey
por: Jiang, Bowen, et al.
Publicado: (2024)
por: Jiang, Bowen, et al.
Publicado: (2024)
Debiasing Watermarks for Large Language Models via Maximal Coupling
por: Xie, Yangxinyu, et al.
Publicado: (2024)
por: Xie, Yangxinyu, et al.
Publicado: (2024)
Comparative Evaluation of Prompting and Fine-Tuning for Applying Large Language Models to Grid-Structured Geospatial Data
por: Dhruv, Akash, et al.
Publicado: (2025)
por: Dhruv, Akash, et al.
Publicado: (2025)
GeoGrid-Bench: Can Foundation Models Understand Multimodal Gridded Geo-Spatial Data?
por: Jiang, Bowen, et al.
Publicado: (2025)
por: Jiang, Bowen, et al.
Publicado: (2025)
SCORE: Specificity, Context Utilization, Robustness, and Relevance for Reference-Free LLM Evaluation
por: Shomee, Homaira Huda, et al.
Publicado: (2026)
por: Shomee, Homaira Huda, et al.
Publicado: (2026)
A RAG-Based Multi-Agent LLM System for Natural Hazard Resilience and Adaptation
por: Xie, Yangxinyu, et al.
Publicado: (2025)
por: Xie, Yangxinyu, et al.
Publicado: (2025)
Know Me, Respond to Me: Benchmarking LLMs for Dynamic User Profiling and Personalized Responses at Scale
por: Jiang, Bowen, et al.
Publicado: (2025)
por: Jiang, Bowen, et al.
Publicado: (2025)
Statistical Early Stopping for Reasoning Models
por: Xie, Yangxinyu, et al.
Publicado: (2026)
por: Xie, Yangxinyu, et al.
Publicado: (2026)
MOSAIC: Multi-agent Orchestration for Task-Intelligent Scientific Coding
por: Raghavan, Siddeshwar, et al.
Publicado: (2025)
por: Raghavan, Siddeshwar, et al.
Publicado: (2025)
Multi-Agent VQA: Exploring Multi-Agent Foundation Models in Zero-Shot Visual Question Answering
por: Jiang, Bowen, et al.
Publicado: (2024)
por: Jiang, Bowen, et al.
Publicado: (2024)
WildfireGPT: Tailored Large Language Model for Wildfire Analysis
por: Xie, Yangxinyu, et al.
Publicado: (2024)
por: Xie, Yangxinyu, et al.
Publicado: (2024)
ChatVis: Automating Scientific Visualization with a Large Language Model
por: Mallick, Tanwi, et al.
Publicado: (2024)
por: Mallick, Tanwi, et al.
Publicado: (2024)
A Law of Next-Token Prediction in Large Language Models
por: He, Hangfeng, et al.
Publicado: (2024)
por: He, Hangfeng, et al.
Publicado: (2024)
LUMINA: Detecting Hallucinations in RAG System with Context-Knowledge Signals
por: Yeh, Samuel, et al.
Publicado: (2025)
por: Yeh, Samuel, et al.
Publicado: (2025)
ControlText: Unlocking Controllable Fonts in Multilingual Text Rendering without Font Annotations
por: Jiang, Bowen, et al.
Publicado: (2025)
por: Jiang, Bowen, et al.
Publicado: (2025)
Length-MAX Tokenizer for Language Models
por: Dong, Dong, et al.
Publicado: (2025)
por: Dong, Dong, et al.
Publicado: (2025)
Problematic Tokens: Tokenizer Bias in Large Language Models
por: Yang, Jin, et al.
Publicado: (2024)
por: Yang, Jin, et al.
Publicado: (2024)
SocREval: Large Language Models with the Socratic Method for Reference-Free Reasoning Evaluation
por: He, Hangfeng, et al.
Publicado: (2023)
por: He, Hangfeng, et al.
Publicado: (2023)
Large Reasoning Models Are (Not Yet) Multilingual Latent Reasoners
por: Liu, Yihong, et al.
Publicado: (2026)
por: Liu, Yihong, et al.
Publicado: (2026)
Large Language Models Cannot Self-Correct Reasoning Yet
por: Huang, Jie, et al.
Publicado: (2023)
por: Huang, Jie, et al.
Publicado: (2023)
PersonaMem-v2: Towards Personalized Intelligence via Learning Implicit User Personas and Agentic Memory
por: Jiang, Bowen, et al.
Publicado: (2025)
por: Jiang, Bowen, et al.
Publicado: (2025)
Peeking Into The Future For Contextual Biasing
por: Selvakumar, Ramaneswaran, et al.
Publicado: (2025)
por: Selvakumar, Ramaneswaran, et al.
Publicado: (2025)
Reasoning is about giving reasons
por: Shah, Krunal, et al.
Publicado: (2025)
por: Shah, Krunal, et al.
Publicado: (2025)
SAKE: Structured Agentic Knowledge Extrapolation for Complex LLM Reasoning via Reinforcement Learning
por: He, Jiashu, et al.
Publicado: (2025)
por: He, Jiashu, et al.
Publicado: (2025)
Watermark in the Classroom: A Conformal Framework for Adaptive AI Usage Detection
por: Xie, Yangxinyu, et al.
Publicado: (2025)
por: Xie, Yangxinyu, et al.
Publicado: (2025)
BiasCause: Evaluate Socially Biased Causal Reasoning of Large Language Models
por: Xie, Tian, et al.
Publicado: (2025)
por: Xie, Tian, et al.
Publicado: (2025)
Reasoning Bias of Next Token Prediction Training
por: Lin, Pengxiao, et al.
Publicado: (2025)
por: Lin, Pengxiao, et al.
Publicado: (2025)
Analyzing Regional Impacts of Climate Change using Natural Language Processing Techniques
por: Mallick, Tanwi, et al.
Publicado: (2024)
por: Mallick, Tanwi, et al.
Publicado: (2024)
An Explicit Syllogistic Legal Reasoning Framework for Large Language Models
por: Zhang, Kepu, et al.
Publicado: (2025)
por: Zhang, Kepu, et al.
Publicado: (2025)
Yet Another Watermark for Large Language Models
por: Bao, Siyuan, et al.
Publicado: (2025)
por: Bao, Siyuan, et al.
Publicado: (2025)
Mitigating Prompt-Induced Hallucinations in Large Language Models via Structured Reasoning
por: Hao, Jinbo, et al.
Publicado: (2026)
por: Hao, Jinbo, et al.
Publicado: (2026)
Meta-Cognitive Analysis: Evaluating Declarative and Procedural Knowledge in Datasets and Large Language Models
por: Li, Zhuoqun, et al.
Publicado: (2024)
por: Li, Zhuoqun, et al.
Publicado: (2024)
BiasGuard: A Reasoning-enhanced Bias Detection Tool For Large Language Models
por: Fan, Zhiting, et al.
Publicado: (2025)
por: Fan, Zhiting, et al.
Publicado: (2025)
Less Languages, Less Tokens: An Efficient Unified Logic Cross-lingual Chain-of-Thought Reasoning Framework
por: Zhang, Chenyuan, et al.
Publicado: (2026)
por: Zhang, Chenyuan, et al.
Publicado: (2026)
Wavelet-Inspired Multiscale Graph Convolutional Recurrent Network for Traffic Forecasting
por: Qian, Qipeng, et al.
Publicado: (2024)
por: Qian, Qipeng, et al.
Publicado: (2024)
No Test Cases, No Problem: Distillation-Driven Code Generation for Scientific Workflows
por: Raghavan, Siddeshwar, et al.
Publicado: (2026)
por: Raghavan, Siddeshwar, et al.
Publicado: (2026)
GIVE: Structured Reasoning of Large Language Models with Knowledge Graph Inspired Veracity Extrapolation
por: He, Jiashu, et al.
Publicado: (2024)
por: He, Jiashu, et al.
Publicado: (2024)
One Model, All Roles: Multi-Turn, Multi-Agent Self-Play Reinforcement Learning for Conversational Social Intelligence
por: Jiang, Bowen, et al.
Publicado: (2026)
por: Jiang, Bowen, et al.
Publicado: (2026)
Token-wise Influential Training Data Retrieval for Large Language Models
por: Lin, Huawei, et al.
Publicado: (2024)
por: Lin, Huawei, et al.
Publicado: (2024)
Do Thinking Tokens Help or Trap? Towards More Efficient Large Reasoning Model
por: Ding, Bowen, et al.
Publicado: (2025)
por: Ding, Bowen, et al.
Publicado: (2025)
Ejemplares similares
-
Towards Rationality in Language and Multimodal Agents: A Survey
por: Jiang, Bowen, et al.
Publicado: (2024) -
Debiasing Watermarks for Large Language Models via Maximal Coupling
por: Xie, Yangxinyu, et al.
Publicado: (2024) -
Comparative Evaluation of Prompting and Fine-Tuning for Applying Large Language Models to Grid-Structured Geospatial Data
por: Dhruv, Akash, et al.
Publicado: (2025) -
GeoGrid-Bench: Can Foundation Models Understand Multimodal Gridded Geo-Spatial Data?
por: Jiang, Bowen, et al.
Publicado: (2025) -
SCORE: Specificity, Context Utilization, Robustness, and Relevance for Reference-Free LLM Evaluation
por: Shomee, Homaira Huda, et al.
Publicado: (2026)