Nondeterministic Polynomial-time Problem Challenge: An Ever-Scaling Reasoning Benchmark for LLMs
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Yang, Chang, Wang, Ruiyu, Jiang, Junzhe, Jiang, Qi, Zhang, Qinggang, Deng, Yanchen, Li, Shuxin, Hu, Shuyue, Li, Bo, Pokorny, Florian T., Huang, Xiao, Wang, Xinrun |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
FinMaster: A Holistic Benchmark for Mastering Full-Pipeline Financial Workflows with LLMs
par: Jiang, Junzhe, et autres
Publié: (2025)
par: Jiang, Junzhe, et autres
Publié: (2025)
LLM-Based World Models Can Make Decisions Solely, But Rigorous Evaluations are Needed
par: Yang, Chang, et autres
Publié: (2024)
par: Yang, Chang, et autres
Publié: (2024)
Why Regression? Binary Encoding Classification Brings Confidence to Stock Market Index Price Prediction
par: Jiang, Junzhe, et autres
Publié: (2025)
par: Jiang, Junzhe, et autres
Publié: (2025)
GDBA Revisited: Unleashing the Power of Guided Local Search for Distributed Constraint Optimization
par: Deng, Yanchen, et autres
Publié: (2025)
par: Deng, Yanchen, et autres
Publié: (2025)
Resolving Latency and Inventory Risk in Market Making with Reinforcement Learning
par: Jiang, Junzhe, et autres
Publié: (2025)
par: Jiang, Junzhe, et autres
Publié: (2025)
Configurable Mirror Descent: Towards a Unification of Decision Making
par: Li, Pengdeng, et autres
Publié: (2024)
par: Li, Pengdeng, et autres
Publié: (2024)
Algorithmic Analysis of Termination Problems for Nondeterministic Quantum Programs
par: Fu, Jianling, et autres
Publié: (2024)
par: Fu, Jianling, et autres
Publié: (2024)
RealCraft: Attention Control as A Tool for Zero-Shot Consistent Video Editing
par: Jin, Shutong, et autres
Publié: (2023)
par: Jin, Shutong, et autres
Publié: (2023)
PACA: Perspective-Aware Cross-Attention Representation for Zero-Shot Scene Rearrangement
par: Jin, Shutong, et autres
Publié: (2024)
par: Jin, Shutong, et autres
Publié: (2024)
How Physics and Background Attributes Impact Video Transformers in Robotic Manipulation: A Case Study on Planar Pushing
par: Jin, Shutong, et autres
Publié: (2023)
par: Jin, Shutong, et autres
Publié: (2023)
PALM: Enhanced Generalizability for Local Visuomotor Policies via Perception Alignment
par: Wang, Ruiyu, et autres
Publié: (2026)
par: Wang, Ruiyu, et autres
Publié: (2026)
Simulating Polynomial-Time Nondeterministic Turing Machines via Nondeterministic Turing Machines
par: Lin, Tianrong
Publié: (2024)
par: Lin, Tianrong
Publié: (2024)
Reinforcement Nash Equilibrium Solver
par: Wang, Xinrun, et autres
Publié: (2024)
par: Wang, Xinrun, et autres
Publié: (2024)
Self-adaptive PSRO: Towards an Automatic Population-based Game Solver
par: Li, Pengdeng, et autres
Publié: (2024)
par: Li, Pengdeng, et autres
Publié: (2024)
Grasper: A Generalist Pursuer for Pursuit-Evasion Problems
par: Li, Pengdeng, et autres
Publié: (2024)
par: Li, Pengdeng, et autres
Publié: (2024)
STAR: A First-Ever Dataset and A Large-Scale Benchmark for Scene Graph Generation in Large-Size Satellite Imagery
par: Li, Yansheng, et autres
Publié: (2024)
par: Li, Yansheng, et autres
Publié: (2024)
StarDojo: Benchmarking Open-Ended Behaviors of Agentic Multimodal LLMs in Production-Living Simulations with Stardew Valley
par: Tan, Weihao, et autres
Publié: (2025)
par: Tan, Weihao, et autres
Publié: (2025)
R900: Understanding the Cost-Effectiveness of Random Exploration from 900 Hours of Robotic Data Collection
par: Jin, Shutong, et autres
Publié: (2025)
par: Jin, Shutong, et autres
Publié: (2025)
Solving Urban Network Security Games: Learning Platform, Benchmark, and Challenge for AI Research
par: Zhuang, Shuxin, et autres
Publié: (2025)
par: Zhuang, Shuxin, et autres
Publié: (2025)
Q*: Improving Multi-step Reasoning for LLMs with Deliberative Planning
par: Wang, Chaojie, et autres
Publié: (2024)
par: Wang, Chaojie, et autres
Publié: (2024)
In-Context Exploiter for Extensive-Form Games
par: Li, Shuxin, et autres
Publié: (2024)
par: Li, Shuxin, et autres
Publié: (2024)
The Agent Use of Agent Beings: Agent Cybernetics Is the Missing Science of Foundation Agents
par: Wang, Xinrun, et autres
Publié: (2026)
par: Wang, Xinrun, et autres
Publié: (2026)
Federated Learning for Large-Scale Cloud Robotic Manipulation: Opportunities and Challenges
par: Zaland, Obaidullah, et autres
Publié: (2025)
par: Zaland, Obaidullah, et autres
Publié: (2025)
Feature Extractor or Decision Maker: Rethinking the Role of Visual Encoders in Visuomotor Policies
par: Wang, Ruiyu, et autres
Publié: (2024)
par: Wang, Ruiyu, et autres
Publié: (2024)
Double Oracle Neural Architecture Search for Game Theoretic Deep Learning Models
par: Aung, Aye Phyu Phyu, et autres
Publié: (2024)
par: Aung, Aye Phyu Phyu, et autres
Publié: (2024)
Xiezhi: An Ever-Updating Benchmark for Holistic Domain Knowledge Evaluation
par: Gu, Zhouhong, et autres
Publié: (2023)
par: Gu, Zhouhong, et autres
Publié: (2023)
On Approximation Algorithms for Commutative Quaternion Polynomial Optimization
par: He, Chang, et autres
Publié: (2025)
par: He, Chang, et autres
Publié: (2025)
FaithfulRAG: Fact-Level Conflict Modeling for Context-Faithful Retrieval-Augmented Generation
par: Zhang, Qinggang, et autres
Publié: (2025)
par: Zhang, Qinggang, et autres
Publié: (2025)
DeepPHY: Benchmarking Agentic VLMs on Physical Reasoning
par: Xu, Xinrun, et autres
Publié: (2025)
par: Xu, Xinrun, et autres
Publié: (2025)
Video-MME: The First-Ever Comprehensive Evaluation Benchmark of Multi-modal LLMs in Video Analysis
par: Fu, Chaoyou, et autres
Publié: (2024)
par: Fu, Chaoyou, et autres
Publié: (2024)
Benchmarking Spatiotemporal Reasoning in LLMs and Reasoning Models: Capabilities and Challenges
par: Quan, Pengrui, et autres
Publié: (2025)
par: Quan, Pengrui, et autres
Publié: (2025)
A Soft, Centimeter‐Scaled, Thin‐Cable‐Crawling Robot for Narrow Space Inspection
par: Wentao Ma, et autres
Publié: (2024)
par: Wentao Ma, et autres
Publié: (2024)
Polynomial Complementation of Nondeterministic 2-Way Finite Automata by 1-Limited Automata
par: Guillon, Bruno, et autres
Publié: (2025)
par: Guillon, Bruno, et autres
Publié: (2025)
Diagonalization of Polynomial-Time Deterministic Turing Machines via Nondeterministic Turing Machines
par: Lin, Tianrong
Publié: (2021)
par: Lin, Tianrong
Publié: (2021)
INTEGRALBENCH: Benchmarking LLMs with Definite Integral Problems
par: Tang, Bintao, et autres
Publié: (2025)
par: Tang, Bintao, et autres
Publié: (2025)
Speech LLMs are Contextual Reasoning Transcribers
par: Deng, Keqi, et autres
Publié: (2026)
par: Deng, Keqi, et autres
Publié: (2026)
LLMs for Relational Reasoning: How Far are We?
par: Li, Zhiming, et autres
Publié: (2024)
par: Li, Zhiming, et autres
Publié: (2024)
All Changes May Have Invariant Principles: Improving Ever-Shifting Harmful Meme Detection via Design Concept Reproduction
par: Jiang, Ziyou, et autres
Publié: (2026)
par: Jiang, Ziyou, et autres
Publié: (2026)
Reliable Reasoning Path: Distilling Effective Guidance for LLM Reasoning with Knowledge Graphs
par: Xiao, Yilin, et autres
Publié: (2025)
par: Xiao, Yilin, et autres
Publié: (2025)
Nondeterministic Behaviours in Double Categorical Systems Theory
par: Wang, Paul Zhongpeng
Publié: (2025)
par: Wang, Paul Zhongpeng
Publié: (2025)
Documents similaires
-
FinMaster: A Holistic Benchmark for Mastering Full-Pipeline Financial Workflows with LLMs
par: Jiang, Junzhe, et autres
Publié: (2025) -
LLM-Based World Models Can Make Decisions Solely, But Rigorous Evaluations are Needed
par: Yang, Chang, et autres
Publié: (2024) -
Why Regression? Binary Encoding Classification Brings Confidence to Stock Market Index Price Prediction
par: Jiang, Junzhe, et autres
Publié: (2025) -
GDBA Revisited: Unleashing the Power of Guided Local Search for Distributed Constraint Optimization
par: Deng, Yanchen, et autres
Publié: (2025) -
Resolving Latency and Inventory Risk in Market Making with Reinforcement Learning
par: Jiang, Junzhe, et autres
Publié: (2025)