Saved in:
| Main Authors: | Nangia, Ayush, Mishra, Shikhar, Gokrani, Aman, Chopra, Paras |
|---|---|
| Format: | Preprint |
| Published: |
2026
|
| Subjects: | |
| Online Access: | https://arxiv.org/abs/2602.19594 |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
EsoLang-Bench: Evaluating Genuine Reasoning in Large Language Models via Esoteric Programming Languages
by: Sharma, Aman, et al.
Published: (2026)
by: Sharma, Aman, et al.
Published: (2026)
The Sequential Edge: Inverse-Entropy Voting Beats Parallel Self-Consistency at Matched Compute
by: Sharma, Aman, et al.
Published: (2025)
by: Sharma, Aman, et al.
Published: (2025)
Think Just Enough: Sequence-Level Entropy as a Confidence Signal for LLM Reasoning
by: Sharma, Aman, et al.
Published: (2025)
by: Sharma, Aman, et al.
Published: (2025)
Hybrid Neural World Models
by: Lakshmanan, Pranav, et al.
Published: (2026)
by: Lakshmanan, Pranav, et al.
Published: (2026)
Future Is Unevenly Distributed: Forecasting Ability of LLMs Depends on What We're Asking
by: Karkar, Chinmay, et al.
Published: (2025)
by: Karkar, Chinmay, et al.
Published: (2025)
Language Models Entangle Language and Culture
by: Jain, Shourya, et al.
Published: (2026)
by: Jain, Shourya, et al.
Published: (2026)
Why LLMs Aren't Scientists Yet: Lessons from Four Autonomous Research Attempts
by: Trehan, Dhruv, et al.
Published: (2026)
by: Trehan, Dhruv, et al.
Published: (2026)
Building Interpretable Models for Moral Decision-Making
by: Goel, Mayank, et al.
Published: (2026)
by: Goel, Mayank, et al.
Published: (2026)
Discovering Reinforcement Learning Interfaces with Large Language Models
by: Jaswal, Akshat Singh, et al.
Published: (2026)
by: Jaswal, Akshat Singh, et al.
Published: (2026)
METIS: Mentoring Engine for Thoughtful Inquiry & Solutions
by: Kumar, Abhinav Rajeev, et al.
Published: (2026)
by: Kumar, Abhinav Rajeev, et al.
Published: (2026)
SWT-Bench: Testing and Validating Real-World Bug-Fixes with Code Agents
by: Mündler, Niels, et al.
Published: (2024)
by: Mündler, Niels, et al.
Published: (2024)
DEI: Diversity in Evolutionary Inference for Quality-Diversity Search
by: Donaghy, John, et al.
Published: (2026)
by: Donaghy, John, et al.
Published: (2026)
Can Large Language Models Infer Causal Relationships from Real-World Text?
by: Saklad, Ryan, et al.
Published: (2025)
by: Saklad, Ryan, et al.
Published: (2025)
Enriching the Machine Learning Workloads in BigBench
by: Polag, Matthias, et al.
Published: (2024)
by: Polag, Matthias, et al.
Published: (2024)
Execution-Grounded Credit Assignment for GRPO in Code Generation
by: Kumar, Abhijit, et al.
Published: (2026)
by: Kumar, Abhijit, et al.
Published: (2026)
StockBench: Can LLM Agents Trade Stocks Profitably In Real-world Markets?
by: Chen, Yanxu, et al.
Published: (2025)
by: Chen, Yanxu, et al.
Published: (2025)
Is it Bigger than a Breadbox: Efficient Cardinality Estimation for Real World Workloads
by: Yi, Zixuan, et al.
Published: (2025)
by: Yi, Zixuan, et al.
Published: (2025)
Cross-Platform Hate Speech Detection with Weakly Supervised Causal Disentanglement
by: Sheth, Paras, et al.
Published: (2024)
by: Sheth, Paras, et al.
Published: (2024)
TRIP-Bench: A Benchmark for Long-Horizon Interactive Agents in Real-World Scenarios
by: Shen, Yuanzhe, et al.
Published: (2026)
by: Shen, Yuanzhe, et al.
Published: (2026)
MCP-AgentBench: Evaluating Real-World Language Agent Performance with MCP-Mediated Tools
by: Guo, Zikang, et al.
Published: (2025)
by: Guo, Zikang, et al.
Published: (2025)
VoxelCodeBench: Benchmarking 3D World Modeling Through Code Generation
by: Zheng, Yan, et al.
Published: (2026)
by: Zheng, Yan, et al.
Published: (2026)
LLM Zeroth-Order Fine-Tuning is an Inference Workload
by: Li, Zelin, et al.
Published: (2026)
by: Li, Zelin, et al.
Published: (2026)
LiveClawBench: Benchmarking LLM Agents on Complex, Real-World Assistant Tasks
by: Long, Xiang, et al.
Published: (2026)
by: Long, Xiang, et al.
Published: (2026)
Comprehensive Study on Performance Evaluation and Optimization of Model Compression: Bridging Traditional Deep Learning and Large Language Models
by: Saxena, Aayush, et al.
Published: (2024)
by: Saxena, Aayush, et al.
Published: (2024)
Confucius Code Agent: Scalable Agent Scaffolding for Real-World Codebases
by: Wong, Sherman, et al.
Published: (2025)
by: Wong, Sherman, et al.
Published: (2025)
First 100 days of pandemic; an interplay of pharmaceutical, behavioral and digital interventions -- A study using agent based modeling
by: Gupta, Gauri, et al.
Published: (2024)
by: Gupta, Gauri, et al.
Published: (2024)
SkillLearnBench: Benchmarking Continual Learning Methods for Agent Skill Generation on Real-World Tasks
by: Zhong, Shanshan, et al.
Published: (2026)
by: Zhong, Shanshan, et al.
Published: (2026)
IDE-Bench: Evaluating Large Language Models as IDE Agents on Real-World Software Engineering Tasks
by: Mateega, Spencer, et al.
Published: (2026)
by: Mateega, Spencer, et al.
Published: (2026)
Can Coding Agents Be General Agents?
by: Ivanov, Maksim, et al.
Published: (2026)
by: Ivanov, Maksim, et al.
Published: (2026)
RealBench: Benchmarking Verilog Generation Models with Real-World IP Designs
by: Jin, Pengwei, et al.
Published: (2025)
by: Jin, Pengwei, et al.
Published: (2025)
Source-Free Domain Adaptation with Diffusion-Guided Source Data Generation
by: Chopra, Shivang, et al.
Published: (2024)
by: Chopra, Shivang, et al.
Published: (2024)
Focus Where It Matters: Graph Selective State Focused Attention Networks
by: Vashistha, Shikhar, et al.
Published: (2024)
by: Vashistha, Shikhar, et al.
Published: (2024)
AD-Bench: A Real-World, Trajectory-Aware Advertising Analytics Benchmark for LLM Agents
by: Hu, Lingxiang, et al.
Published: (2026)
by: Hu, Lingxiang, et al.
Published: (2026)
BountyBench: Dollar Impact of AI Agent Attackers and Defenders on Real-World Cybersecurity Systems
by: Zhang, Andy K., et al.
Published: (2025)
by: Zhang, Andy K., et al.
Published: (2025)
SWE-Bench-CL: Continual Learning for Coding Agents
by: Joshi, Thomas, et al.
Published: (2025)
by: Joshi, Thomas, et al.
Published: (2025)
Introducing CausalBench: A Flexible Benchmark Framework for Causal Analysis and Machine Learning
by: Kapkiç, Ahmet, et al.
Published: (2024)
by: Kapkiç, Ahmet, et al.
Published: (2024)
CirrusBench: Evaluating LLM-based Agents Beyond Correctness in Real-World Cloud Service Environments
by: Yu, Yi, et al.
Published: (2026)
by: Yu, Yi, et al.
Published: (2026)
Characterizing LLM Inference Energy-Performance Tradeoffs across Workloads and GPU Scaling
by: Maliakel, Paul Joe, et al.
Published: (2025)
by: Maliakel, Paul Joe, et al.
Published: (2025)
A Control Theoretic Framework for Adaptive Gradient Optimizers in Machine Learning
by: Chakrabarti, Kushal, et al.
Published: (2022)
by: Chakrabarti, Kushal, et al.
Published: (2022)
Optimizing LLM Queries in Relational Data Analytics Workloads
by: Liu, Shu, et al.
Published: (2024)
by: Liu, Shu, et al.
Published: (2024)
Similar Items
-
EsoLang-Bench: Evaluating Genuine Reasoning in Large Language Models via Esoteric Programming Languages
by: Sharma, Aman, et al.
Published: (2026) -
The Sequential Edge: Inverse-Entropy Voting Beats Parallel Self-Consistency at Matched Compute
by: Sharma, Aman, et al.
Published: (2025) -
Think Just Enough: Sequence-Level Entropy as a Confidence Signal for LLM Reasoning
by: Sharma, Aman, et al.
Published: (2025) -
Hybrid Neural World Models
by: Lakshmanan, Pranav, et al.
Published: (2026) -
Future Is Unevenly Distributed: Forecasting Ability of LLMs Depends on What We're Asking
by: Karkar, Chinmay, et al.
Published: (2025)