Code as Agent Harness
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Ning, Xuying, Tieu, Katherine, Fu, Dongqi, Wei, Tianxin, Li, Zihao, Bei, Yuanchen, Zou, Jiaru, Ai, Mengting, Liu, Zhining, Li, Ting-Wei, Chen, Lingjie, Zhao, Yanjun, Yang, Ke, Li, Bingxuan, Qian, Cheng, Li, Gaotang, Lin, Xiao, Zeng, Zhichen, Qiu, Ruizhong, Chen, Sirui, Sun, Yifan, Yang, Xiyuan, Wang, Ruida, Pan, Rui, Yang, Chenyuan, Zhang, Dylan, Fang, Liri, Cui, Zikun, Cao, Yang, Chen, Pan, Sun, Dorothy, Chen, Ren, Srinivasan, Mahesh, Mathur, Nipun, Xia, Yinglong, Li, Hong, Yan, Hong, Lu, Pan, Zhang, Lingming, Zhang, Tong, Tong, Hanghang, He, Jingrui |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Saffron-1: Safety Inference Scaling
par: Qiu, Ruizhong, et autres
Publié: (2025)
par: Qiu, Ruizhong, et autres
Publié: (2025)
Graph Homophily Booster: Rethinking the Role of Discrete Features on Heterophilic Graphs
par: Qiu, Ruizhong, et autres
Publié: (2025)
par: Qiu, Ruizhong, et autres
Publié: (2025)
Graph homophily booster: Reimagining the role of discrete features in heterophilic graph learning
par: Qiu, Ruizhong, et autres
Publié: (2026)
par: Qiu, Ruizhong, et autres
Publié: (2026)
Taming Knowledge Conflicts in Language Models
par: Li, Gaotang, et autres
Publié: (2025)
par: Li, Gaotang, et autres
Publié: (2025)
Latent Collaboration in Multi-Agent Systems
par: Zou, Jiaru, et autres
Publié: (2025)
par: Zou, Jiaru, et autres
Publié: (2025)
ALERT: Zero-shot LLM Jailbreak Detection via Internal Discrepancy Amplification
par: Lin, Xiao, et autres
Publié: (2026)
par: Lin, Xiao, et autres
Publié: (2026)
PaperMind: Benchmarking Agentic Reasoning and Critique over Scientific Papers in Multimodal LLMs
par: Zhao, Yanjun, et autres
Publié: (2026)
par: Zhao, Yanjun, et autres
Publié: (2026)
WAPITI: A Watermark for Finetuned Open-Source LLMs
par: Chen, Lingjie, et autres
Publié: (2024)
par: Chen, Lingjie, et autres
Publié: (2024)
Graph Data Selection for Domain Adaptation: A Model-Free Approach
par: Li, Ting-Wei, et autres
Publié: (2025)
par: Li, Ting-Wei, et autres
Publié: (2025)
Gradient Compressed Sensing: A Query-Efficient Gradient Estimator for High-Dimensional Zeroth-Order Optimization
par: Qiu, Ruizhong, et autres
Publié: (2024)
par: Qiu, Ruizhong, et autres
Publié: (2024)
KernelGPT: Enhanced Kernel Fuzzing via Large Language Models
par: Yang, Chenyuan, et autres
Publié: (2023)
par: Yang, Chenyuan, et autres
Publié: (2023)
Recursive Multi-Agent Systems
par: Yang, Xiyuan, et autres
Publié: (2026)
par: Yang, Xiyuan, et autres
Publié: (2026)
Breaking Silos: Adaptive Model Fusion Unlocks Better Time Series Forecasting
par: Liu, Zhining, et autres
Publié: (2025)
par: Liu, Zhining, et autres
Publié: (2025)
EvoSelect: Data-Efficient LLM Evolution for Targeted Task Adaptation
par: Li, Ting-Wei, et autres
Publié: (2026)
par: Li, Ting-Wei, et autres
Publié: (2026)
Agentic Reasoning for Large Language Models
par: Wei, Tianxin, et autres
Publié: (2026)
par: Wei, Tianxin, et autres
Publié: (2026)
MORALISE: A Structured Benchmark for Moral Alignment in Visual Language Models
par: Lin, Xiao, et autres
Publié: (2025)
par: Lin, Xiao, et autres
Publié: (2025)
BACKTIME: Backdoor Attacks on Multivariate Time Series Forecasting
par: Lin, Xiao, et autres
Publié: (2024)
par: Lin, Xiao, et autres
Publié: (2024)
Mem-Gallery: Benchmarking Multimodal Long-Term Conversational Memory for MLLM Agents
par: Bei, Yuanchen, et autres
Publié: (2026)
par: Bei, Yuanchen, et autres
Publié: (2026)
KNighter: Transforming Static Analysis with LLM-Synthesized Checkers
par: Yang, Chenyuan, et autres
Publié: (2025)
par: Yang, Chenyuan, et autres
Publié: (2025)
Hierarchical Multi-Marginal Optimal Transport for Network Alignment
par: Zeng, Zhichen, et autres
Publié: (2023)
par: Zeng, Zhichen, et autres
Publié: (2023)
CLIMB: Class-imbalanced Learning Benchmark on Tabular Data
par: Liu, Zhining, et autres
Publié: (2025)
par: Liu, Zhining, et autres
Publié: (2025)
AIM: Attributing, Interpreting, Mitigating Data Unfairness
par: Liu, Zhining, et autres
Publié: (2024)
par: Liu, Zhining, et autres
Publié: (2024)
SelfElicit: Your Language Model Secretly Knows Where is the Relevant Evidence
par: Liu, Zhining, et autres
Publié: (2025)
par: Liu, Zhining, et autres
Publié: (2025)
ReMix: Reinforcement routing for mixtures of LoRAs in LLM finetuning
par: Qiu, Ruizhong, et autres
Publié: (2026)
par: Qiu, Ruizhong, et autres
Publié: (2026)
Harnessing Consistency for Robust Test-Time LLM Ensemble
par: Zeng, Zhichen, et autres
Publié: (2025)
par: Zeng, Zhichen, et autres
Publié: (2025)
Fuzzing Automatic Differentiation in Deep-Learning Libraries
par: Yang, Chenyuan, et autres
Publié: (2023)
par: Yang, Chenyuan, et autres
Publié: (2023)
Latte: Collaborative Test-Time Adaptation of Vision-Language Models in Federated Learning
par: Bao, Wenxuan, et autres
Publié: (2025)
par: Bao, Wenxuan, et autres
Publié: (2025)
MC-Search: Evaluating and Enhancing Multimodal Agentic Search with Structured Long Reasoning Chains
par: Ning, Xuying, et autres
Publié: (2026)
par: Ning, Xuying, et autres
Publié: (2026)
Heterogeneous Scientific Foundation Model Collaboration
par: Li, Zihao, et autres
Publié: (2026)
par: Li, Zihao, et autres
Publié: (2026)
ClimateBench-M: A Multi-Modal Climate Data Benchmark with a Simple Generative Method
par: Fu, Dongqi, et autres
Publié: (2025)
par: Fu, Dongqi, et autres
Publié: (2025)
Supramolecular Polymer‐Based Ionogels Enable Large‐Scale Fabrication of Stable Smart Windows with Room‐Temperature Closed‐Loop Recyclability and Self‐Healing Capability
par: Chen Hong, et autres
Publié: (2024)
par: Chen Hong, et autres
Publié: (2024)
AdaFuse: Adaptive Ensemble Decoding with Test-Time Scaling for LLMs
par: Cui, Chengming, et autres
Publié: (2026)
par: Cui, Chengming, et autres
Publié: (2026)
TRIMS: Trajectory-Ranked Instruction Masked Supervision for Diffusion Language Models
par: Chen, Lingjie, et autres
Publié: (2026)
par: Chen, Lingjie, et autres
Publié: (2026)
TSAQA: Time Series Analysis Question And Answering Benchmark
par: Jing, Baoyu, et autres
Publié: (2026)
par: Jing, Baoyu, et autres
Publié: (2026)
CATS: Mitigating Correlation Shift for Multivariate Time Series Classification
par: Lin, Xiao, et autres
Publié: (2025)
par: Lin, Xiao, et autres
Publié: (2025)
AnyPoC: Universal Proof-of-Concept Test Generation for Scalable LLM-Based Bug Detection
par: Zhao, Zijie, et autres
Publié: (2026)
par: Zhao, Zijie, et autres
Publié: (2026)
Discrete-state Continuous-time Diffusion for Graph Generation
par: Xu, Zhe, et autres
Publié: (2024)
par: Xu, Zhe, et autres
Publié: (2024)
Long-tailed Medical Diagnosis with Relation-aware Representation Learning and Iterative Classifier Calibration
par: Pan, Li, et autres
Publié: (2025)
par: Pan, Li, et autres
Publié: (2025)
Unified Multi-modal Diagnostic Framework with Reconstruction Pre-training and Heterogeneity-combat Tuning
par: Zhang, Yupei, et autres
Publié: (2024)
par: Zhang, Yupei, et autres
Publié: (2024)
What Do LLMs Need to Understand Graphs: A Survey of Parametric Representation of Graphs
par: Fu, Dongqi, et autres
Publié: (2024)
par: Fu, Dongqi, et autres
Publié: (2024)
Documents similaires
-
Saffron-1: Safety Inference Scaling
par: Qiu, Ruizhong, et autres
Publié: (2025) -
Graph Homophily Booster: Rethinking the Role of Discrete Features on Heterophilic Graphs
par: Qiu, Ruizhong, et autres
Publié: (2025) -
Graph homophily booster: Reimagining the role of discrete features in heterophilic graph learning
par: Qiu, Ruizhong, et autres
Publié: (2026) -
Taming Knowledge Conflicts in Language Models
par: Li, Gaotang, et autres
Publié: (2025) -
Latent Collaboration in Multi-Agent Systems
par: Zou, Jiaru, et autres
Publié: (2025)