HINTBench: Horizon-agent Intrinsic Non-attack Trajectory Benchmark
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Wang, Jiacheng, Hou, Jinchang, Wang, Fabian, Jian, Ping, Bao, Chenfu, Lv, Zhonghou |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Safety-Utility Conflicts Are Not Global: Surgical Alignment via Head-Level Diagnosis
par: Cai, Wang, et autres
Publié: (2026)
par: Cai, Wang, et autres
Publié: (2026)
Intrinsic Credit Assignment for Long Horizon Interaction
par: Auzina, Ilze Amanda, et autres
Publié: (2026)
par: Auzina, Ilze Amanda, et autres
Publié: (2026)
A Non-autoregressive Multi-Horizon Flight Trajectory Prediction Framework with Gray Code Representation
par: Guo, Dongyue, et autres
Publié: (2023)
par: Guo, Dongyue, et autres
Publié: (2023)
LiveClin: A Live Clinical Benchmark without Leakage
par: Wang, Xidong, et autres
Publié: (2026)
par: Wang, Xidong, et autres
Publié: (2026)
TRIP-Bench: A Benchmark for Long-Horizon Interactive Agents in Real-World Scenarios
par: Shen, Yuanzhe, et autres
Publié: (2026)
par: Shen, Yuanzhe, et autres
Publié: (2026)
EHRWorld: A Patient-Centric Medical World Model for Long-Horizon Clinical Trajectories
par: Mu, Linjie, et autres
Publié: (2026)
par: Mu, Linjie, et autres
Publié: (2026)
LongCoT: Benchmarking Long-Horizon Chain-of-Thought Reasoning
par: Motwani, Sumeet Ramesh, et autres
Publié: (2026)
par: Motwani, Sumeet Ramesh, et autres
Publié: (2026)
SLMQuant:Benchmarking Small Language Model Quantization for Practical Deployment
par: Wang, Jiacheng, et autres
Publié: (2025)
par: Wang, Jiacheng, et autres
Publié: (2025)
Hierarchical Two-Stage Framework for Environment-Aware Long-Horizon Vessel Trajectory Prediction
par: Gnanavel, Ganeshaaraj, et autres
Publié: (2026)
par: Gnanavel, Ganeshaaraj, et autres
Publié: (2026)
On Training Large Language Models for Long-Horizon Tasks: An Empirical Study of Horizon Length
par: Kim, Sunghwan, et autres
Publié: (2026)
par: Kim, Sunghwan, et autres
Publié: (2026)
C2F-TP: A Coarse-to-Fine Denoising Framework for Uncertainty-Aware Trajectory Prediction
par: Wang, Zichen, et autres
Publié: (2024)
par: Wang, Zichen, et autres
Publié: (2024)
MS$^3$D: A RG Flow-Based Regularization for GAN Training with Limited Data
par: Wang, Jian, et autres
Publié: (2024)
par: Wang, Jian, et autres
Publié: (2024)
Revisiting Synthetic Human Trajectories: Imitative Generation and Benchmarks Beyond Datasaurus
par: Deng, Bangchao, et autres
Publié: (2024)
par: Deng, Bangchao, et autres
Publié: (2024)
DyTTP: Trajectory Prediction with Normalization-Free Transformers
par: Zhu, JianLin, et autres
Publié: (2025)
par: Zhu, JianLin, et autres
Publié: (2025)
STeCa: Step-level Trajectory Calibration for LLM Agent Learning
par: Wang, Hanlin, et autres
Publié: (2025)
par: Wang, Hanlin, et autres
Publié: (2025)
Defense effectiveness across architectural layers: a mechanistic evaluation of persistent memory attacks on stateful LLM agents
par: Leong, Jun Wen
Publié: (2026)
par: Leong, Jun Wen
Publié: (2026)
Learning Off-policy with Model-based Intrinsic Motivation For Active Online Exploration
par: Wang, Yibo, et autres
Publié: (2024)
par: Wang, Yibo, et autres
Publié: (2024)
To Call or Not to Call: Diagnosing Intrinsic Over-Calling Bias in LLM Agents
par: Shi, Wei, et autres
Publié: (2026)
par: Shi, Wei, et autres
Publié: (2026)
TrajAware: Graph Cross-Attention and Trajectory-Aware for Generalisable VANETs under Partial Observations
par: Fu, Xiaolu, et autres
Publié: (2025)
par: Fu, Xiaolu, et autres
Publié: (2025)
Concealed Adversarial attacks on neural networks for sequential data
par: Sokerin, Petr, et autres
Publié: (2025)
par: Sokerin, Petr, et autres
Publié: (2025)
AVA-Bench: Atomic Visual Ability Benchmark for Vision Foundation Models
par: Mai, Zheda, et autres
Publié: (2025)
par: Mai, Zheda, et autres
Publié: (2025)
Prune-OPD: Efficient and Reliable On-Policy Distillation for Long-Horizon Reasoning
par: Yang, Zhicheng, et autres
Publié: (2026)
par: Yang, Zhicheng, et autres
Publié: (2026)
Verifier-Free RL for LLMs via Intrinsic Gradient-Norm Reward
par: Wen, Xuexiang, et autres
Publié: (2026)
par: Wen, Xuexiang, et autres
Publié: (2026)
Intra-Trajectory Consistency for Reward Modeling
par: Zhou, Chaoyang, et autres
Publié: (2025)
par: Zhou, Chaoyang, et autres
Publié: (2025)
Harnesses for Inference-Time Alignment over Execution Trajectories
par: Wang, Boyuan, et autres
Publié: (2026)
par: Wang, Boyuan, et autres
Publié: (2026)
Efficient Reinforcement Learning for Large Language Models with Intrinsic Exploration
par: Sun, Yan, et autres
Publié: (2025)
par: Sun, Yan, et autres
Publié: (2025)
λ: A Benchmark for Data-Efficiency in Long-Horizon Indoor Mobile Manipulation Robotics
par: Jaafar, Ahmed, et autres
Publié: (2024)
par: Jaafar, Ahmed, et autres
Publié: (2024)
Fixed-point graph convolutional networks against adversarial attacks
par: Khan, Shakib, et autres
Publié: (2025)
par: Khan, Shakib, et autres
Publié: (2025)
CityTrajBench: A Unified Benchmark for City-Scale Vehicle Trajectory Generation
par: Zhu, Shibo, et autres
Publié: (2026)
par: Zhu, Shibo, et autres
Publié: (2026)
Curiosity-Critic: Cumulative Prediction Error Improvement as a Tractable Intrinsic Reward for World Model Training
par: Bhaskara, Vin, et autres
Publié: (2026)
par: Bhaskara, Vin, et autres
Publié: (2026)
FedAGHN: Personalized Federated Learning with Attentive Graph HyperNetworks
par: Song, Jiarui, et autres
Publié: (2025)
par: Song, Jiarui, et autres
Publié: (2025)
McCast: Memory-Guided Latent Drift Correction for Long-Horizon Precipitation Nowcasting
par: Wen, Penghui, et autres
Publié: (2026)
par: Wen, Penghui, et autres
Publié: (2026)
GHQ: Grouped Hybrid Q Learning for Heterogeneous Cooperative Multi-agent Reinforcement Learning
par: Yu, Xiaoyang, et autres
Publié: (2023)
par: Yu, Xiaoyang, et autres
Publié: (2023)
Rooted Absorbed Prefix Trajectory Balance with Submodular Replay for GFlowNet Training
par: Wang, Xi, et autres
Publié: (2026)
par: Wang, Xi, et autres
Publié: (2026)
TRACE: Trajectory Recovery with State Propagation Diffusion for Urban Mobility
par: Wang, Jinming, et autres
Publié: (2026)
par: Wang, Jinming, et autres
Publié: (2026)
TrajWeaver: Trajectory Recovery with State Propagation Diffusion Model
par: Wang, Jinming, et autres
Publié: (2024)
par: Wang, Jinming, et autres
Publié: (2024)
Aligning LLM agents with human learning and adjustment behavior: a dual agent approach
par: Liu, Tianming, et autres
Publié: (2025)
par: Liu, Tianming, et autres
Publié: (2025)
Enhancing Noise Robustness of Parkinson's Disease Telemonitoring via Contrastive Feature Augmentation
par: Tang, Ziming, et autres
Publié: (2025)
par: Tang, Ziming, et autres
Publié: (2025)
Task Assignment and Exploration Optimization for Low Altitude UAV Rescue via Generative AI Enhanced Multi-agent Reinforcement Learning
par: Tang, Xin, et autres
Publié: (2025)
par: Tang, Xin, et autres
Publié: (2025)
Deep generative models as an adversarial attack strategy for tabular machine learning
par: Dyrmishi, Salijona, et autres
Publié: (2024)
par: Dyrmishi, Salijona, et autres
Publié: (2024)
Documents similaires
-
Safety-Utility Conflicts Are Not Global: Surgical Alignment via Head-Level Diagnosis
par: Cai, Wang, et autres
Publié: (2026) -
Intrinsic Credit Assignment for Long Horizon Interaction
par: Auzina, Ilze Amanda, et autres
Publié: (2026) -
A Non-autoregressive Multi-Horizon Flight Trajectory Prediction Framework with Gray Code Representation
par: Guo, Dongyue, et autres
Publié: (2023) -
LiveClin: A Live Clinical Benchmark without Leakage
par: Wang, Xidong, et autres
Publié: (2026) -
TRIP-Bench: A Benchmark for Long-Horizon Interactive Agents in Real-World Scenarios
par: Shen, Yuanzhe, et autres
Publié: (2026)