LongCoT: Benchmarking Long-Horizon Chain-of-Thought Reasoning
Fuente:
arXiv
Salvato in:
| Autori principali: | Motwani, Sumeet Ramesh, Nichols, Daniel, London, Charles, Li, Peggy, Pizzati, Fabio, Blake, Acer, Hammoud, Hasan, McDonald, Tavish, Naik, Akshat, Ivanova, Alesia, Baskaran, Vignesh, Laptev, Ivan, Glatt, Ruben, Ben-Nun, Tal, Torr, Philip, Jaques, Natasha, Prabhu, Ameya, Bartoldson, Brian, Kailkhura, Bhavya, de Witt, Christian Schroeder |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
h1: Bootstrapping LLMs to Reason over Longer Horizons via Reinforcement Learning
di: Motwani, Sumeet Ramesh, et al.
Pubblicazione: (2025)
di: Motwani, Sumeet Ramesh, et al.
Pubblicazione: (2025)
Get RICH or Die Scaling: Profitably Trading Inference Compute for Robustness
di: McDonald, Tavish, et al.
Pubblicazione: (2025)
di: McDonald, Tavish, et al.
Pubblicazione: (2025)
Double Visual Defense: Adversarial Pre-training and Instruction Tuning for Improving Vision-Language Model Robustness
di: Wang, Zeyu, et al.
Pubblicazione: (2025)
di: Wang, Zeyu, et al.
Pubblicazione: (2025)
Speculative Diffusion Decoding: Accelerating Language Generation through Diffusion
di: Christopher, Jacob K, et al.
Pubblicazione: (2024)
di: Christopher, Jacob K, et al.
Pubblicazione: (2024)
MALT: Improving Reasoning with Multi-Agent LLM Training
di: Motwani, Sumeet Ramesh, et al.
Pubblicazione: (2024)
di: Motwani, Sumeet Ramesh, et al.
Pubblicazione: (2024)
Adversarial Robustness Limits via Scaling-Law and Human-Alignment Studies
di: Bartoldson, Brian R., et al.
Pubblicazione: (2024)
di: Bartoldson, Brian R., et al.
Pubblicazione: (2024)
SIA: Self Improving AI with Harness & Weight Updates
di: Hebbar, Prannay, et al.
Pubblicazione: (2026)
di: Hebbar, Prannay, et al.
Pubblicazione: (2026)
Trajectory Balance with Asynchrony: Decoupling Exploration and Learning for Fast, Scalable LLM Post-Training
di: Bartoldson, Brian, et al.
Pubblicazione: (2025)
di: Bartoldson, Brian, et al.
Pubblicazione: (2025)
Act Only When It Pays: Efficient Reinforcement Learning for LLM Reasoning via Selective Rollouts
di: Zheng, Haizhong, et al.
Pubblicazione: (2025)
di: Zheng, Haizhong, et al.
Pubblicazione: (2025)
ELFS: Label-Free Coreset Selection with Proxy Training Dynamics
di: Zheng, Haizhong, et al.
Pubblicazione: (2024)
di: Zheng, Haizhong, et al.
Pubblicazione: (2024)
AegisLLM: Scaling Agentic Systems for Self-Reflective Defense in LLM Security
di: Cai, Zikui, et al.
Pubblicazione: (2025)
di: Cai, Zikui, et al.
Pubblicazione: (2025)
Secret Collusion among AI Agents: Multi-Agent Deception via Steganography
di: Motwani, Sumeet Ramesh, et al.
Pubblicazione: (2024)
di: Motwani, Sumeet Ramesh, et al.
Pubblicazione: (2024)
On Pretraining Data Diversity for Self-Supervised Learning
di: Hammoud, Hasan Abed Al Kader, et al.
Pubblicazione: (2024)
di: Hammoud, Hasan Abed Al Kader, et al.
Pubblicazione: (2024)
SynthCLIP: Are We Ready for a Fully Synthetic CLIP Training?
di: Hammoud, Hasan Abed Al Kader, et al.
Pubblicazione: (2024)
di: Hammoud, Hasan Abed Al Kader, et al.
Pubblicazione: (2024)
HorizonMath: Measuring AI Progress Toward Mathematical Discovery with Automatic Verification
di: Wang, Erik Y., et al.
Pubblicazione: (2026)
di: Wang, Erik Y., et al.
Pubblicazione: (2026)
Active Learning Enables Extrapolation in Molecular Generative Models
di: Antoniuk, Evan R., et al.
Pubblicazione: (2025)
di: Antoniuk, Evan R., et al.
Pubblicazione: (2025)
MessyKitchens: Contact-rich object-level 3D scene reconstruction
di: Ansari, Junaid Ahmed, et al.
Pubblicazione: (2026)
di: Ansari, Junaid Ahmed, et al.
Pubblicazione: (2026)
STAR-1: Safer Alignment of Reasoning LLMs with 1K Data
di: Wang, Zijun, et al.
Pubblicazione: (2025)
di: Wang, Zijun, et al.
Pubblicazione: (2025)
LikePhys: Evaluating Intuitive Physics Understanding in Video Diffusion Models via Likelihood Preference
di: Yuan, Jianhao, et al.
Pubblicazione: (2025)
di: Yuan, Jianhao, et al.
Pubblicazione: (2025)
Towards Reliable Identification of Diffusion-based Image Manipulations
di: Costanzino, Alex, et al.
Pubblicazione: (2025)
di: Costanzino, Alex, et al.
Pubblicazione: (2025)
Rebuilding ROME : Resolving Model Collapse during Sequential Model Editing
di: Gupta, Akshat, et al.
Pubblicazione: (2024)
di: Gupta, Akshat, et al.
Pubblicazione: (2024)
Toplogical quibits
di: Richardson, Acer
Pubblicazione: (2025)
di: Richardson, Acer
Pubblicazione: (2025)
a3mabreu/profilereduction: First release
di: Seher Acer
Pubblicazione: (2026)
di: Seher Acer
Pubblicazione: (2026)
Model Merging and Safety Alignment: One Bad Model Spoils the Bunch
di: Hammoud, Hasan Abed Al Kader, et al.
Pubblicazione: (2024)
di: Hammoud, Hasan Abed Al Kader, et al.
Pubblicazione: (2024)
Scaling up Test-Time Compute with Latent Reasoning: A Recurrent Depth Approach
di: Geiping, Jonas, et al.
Pubblicazione: (2025)
di: Geiping, Jonas, et al.
Pubblicazione: (2025)
Specify and Edit: Overcoming Ambiguity in Text-Based Image Editing
di: Iakovleva, Ekaterina, et al.
Pubblicazione: (2024)
di: Iakovleva, Ekaterina, et al.
Pubblicazione: (2024)
FedCluster: Boosting the Convergence of Federated Learning via Cluster-Cycling
di: Chen, Cheng, et al.
Pubblicazione: (2020)
di: Chen, Cheng, et al.
Pubblicazione: (2020)
Improving Robustness In Sparse Autoencoders via Masked Regularization
di: Narayanaswamy, Vivek, et al.
Pubblicazione: (2026)
di: Narayanaswamy, Vivek, et al.
Pubblicazione: (2026)
Certifiably-Robust Federated Adversarial Learning via Randomized Smoothing
di: Chen, Cheng, et al.
Pubblicazione: (2021)
di: Chen, Cheng, et al.
Pubblicazione: (2021)
Training Dynamics of Transformers to Recognize Word Co-occurrence via Gradient Flow Analysis
di: Yang, Hongru, et al.
Pubblicazione: (2024)
di: Yang, Hongru, et al.
Pubblicazione: (2024)
End-to-End Mesh Optimization of a Hybrid Deep Learning Black-Box PDE Solver
di: Ma, Shaocong, et al.
Pubblicazione: (2024)
di: Ma, Shaocong, et al.
Pubblicazione: (2024)
AutoOR: Scalably Post-training LLMs to Autoformalize Operations Research Problems
di: Motwani, Sumeet Ramesh, et al.
Pubblicazione: (2026)
di: Motwani, Sumeet Ramesh, et al.
Pubblicazione: (2026)
BOOM: Benchmarking Out-Of-distribution Molecular Property Predictions of Machine Learning Models
di: Antoniuk, Evan R., et al.
Pubblicazione: (2025)
di: Antoniuk, Evan R., et al.
Pubblicazione: (2025)
PSyDUCK: Training-Free Steganography for Latent Diffusion
di: Mahfuz, Aqib, et al.
Pubblicazione: (2025)
di: Mahfuz, Aqib, et al.
Pubblicazione: (2025)
Unelicitable Backdoors in Language Models via Cryptographic Transformer Circuits
di: Draguns, Andis, et al.
Pubblicazione: (2024)
di: Draguns, Andis, et al.
Pubblicazione: (2024)
Long-Range Interactions in Celestial CFT
di: Choi, Sangmin, et al.
Pubblicazione: (2026)
di: Choi, Sangmin, et al.
Pubblicazione: (2026)
An Enhanced Optical Response and Interfacial Charge Separation of rGO Supported Cu 2+ Doped Co 3 O 4 Heterojunction for Photo‐Fenton‐Like Activity
di: C. Udhayakeerthana, et al.
Pubblicazione: (2025)
di: C. Udhayakeerthana, et al.
Pubblicazione: (2025)
Train Long, Think Short: Curriculum Learning for Efficient Reasoning
di: Hammoud, Hasan Abed Al Kader, et al.
Pubblicazione: (2025)
di: Hammoud, Hasan Abed Al Kader, et al.
Pubblicazione: (2025)
Clear Purpose...Complete Commitment: A Long-Range Program To Provide Louisianians with Library and Information Services Adequate to Their Needs, 1993-1997.
di: Jaques, Thomas F.
Pubblicazione: (1992)
di: Jaques, Thomas F.
Pubblicazione: (1992)
Clear Purpose...Complete Commitment: A Long-Range Program To Provide Louisianians with Library and Information Services Adequate to Their Needs, 1992-1996.
di: Jaques, Thomas F.
Pubblicazione: (1991)
di: Jaques, Thomas F.
Pubblicazione: (1991)
Documenti analoghi
-
h1: Bootstrapping LLMs to Reason over Longer Horizons via Reinforcement Learning
di: Motwani, Sumeet Ramesh, et al.
Pubblicazione: (2025) -
Get RICH or Die Scaling: Profitably Trading Inference Compute for Robustness
di: McDonald, Tavish, et al.
Pubblicazione: (2025) -
Double Visual Defense: Adversarial Pre-training and Instruction Tuning for Improving Vision-Language Model Robustness
di: Wang, Zeyu, et al.
Pubblicazione: (2025) -
Speculative Diffusion Decoding: Accelerating Language Generation through Diffusion
di: Christopher, Jacob K, et al.
Pubblicazione: (2024) -
MALT: Improving Reasoning with Multi-Agent LLM Training
di: Motwani, Sumeet Ramesh, et al.
Pubblicazione: (2024)