HINTBench: Horizon-agent Intrinsic Non-attack Trajectory Benchmark
Fuente:
arXiv
Guardado en:
| Autores principales: | Wang, Jiacheng, Hou, Jinchang, Wang, Fabian, Jian, Ping, Bao, Chenfu, Lv, Zhonghou |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Safety-Utility Conflicts Are Not Global: Surgical Alignment via Head-Level Diagnosis
por: Cai, Wang, et al.
Publicado: (2026)
por: Cai, Wang, et al.
Publicado: (2026)
Intrinsic Credit Assignment for Long Horizon Interaction
por: Auzina, Ilze Amanda, et al.
Publicado: (2026)
por: Auzina, Ilze Amanda, et al.
Publicado: (2026)
A Non-autoregressive Multi-Horizon Flight Trajectory Prediction Framework with Gray Code Representation
por: Guo, Dongyue, et al.
Publicado: (2023)
por: Guo, Dongyue, et al.
Publicado: (2023)
LiveClin: A Live Clinical Benchmark without Leakage
por: Wang, Xidong, et al.
Publicado: (2026)
por: Wang, Xidong, et al.
Publicado: (2026)
TRIP-Bench: A Benchmark for Long-Horizon Interactive Agents in Real-World Scenarios
por: Shen, Yuanzhe, et al.
Publicado: (2026)
por: Shen, Yuanzhe, et al.
Publicado: (2026)
EHRWorld: A Patient-Centric Medical World Model for Long-Horizon Clinical Trajectories
por: Mu, Linjie, et al.
Publicado: (2026)
por: Mu, Linjie, et al.
Publicado: (2026)
LongCoT: Benchmarking Long-Horizon Chain-of-Thought Reasoning
por: Motwani, Sumeet Ramesh, et al.
Publicado: (2026)
por: Motwani, Sumeet Ramesh, et al.
Publicado: (2026)
SLMQuant:Benchmarking Small Language Model Quantization for Practical Deployment
por: Wang, Jiacheng, et al.
Publicado: (2025)
por: Wang, Jiacheng, et al.
Publicado: (2025)
Hierarchical Two-Stage Framework for Environment-Aware Long-Horizon Vessel Trajectory Prediction
por: Gnanavel, Ganeshaaraj, et al.
Publicado: (2026)
por: Gnanavel, Ganeshaaraj, et al.
Publicado: (2026)
On Training Large Language Models for Long-Horizon Tasks: An Empirical Study of Horizon Length
por: Kim, Sunghwan, et al.
Publicado: (2026)
por: Kim, Sunghwan, et al.
Publicado: (2026)
C2F-TP: A Coarse-to-Fine Denoising Framework for Uncertainty-Aware Trajectory Prediction
por: Wang, Zichen, et al.
Publicado: (2024)
por: Wang, Zichen, et al.
Publicado: (2024)
MS$^3$D: A RG Flow-Based Regularization for GAN Training with Limited Data
por: Wang, Jian, et al.
Publicado: (2024)
por: Wang, Jian, et al.
Publicado: (2024)
Revisiting Synthetic Human Trajectories: Imitative Generation and Benchmarks Beyond Datasaurus
por: Deng, Bangchao, et al.
Publicado: (2024)
por: Deng, Bangchao, et al.
Publicado: (2024)
DyTTP: Trajectory Prediction with Normalization-Free Transformers
por: Zhu, JianLin, et al.
Publicado: (2025)
por: Zhu, JianLin, et al.
Publicado: (2025)
STeCa: Step-level Trajectory Calibration for LLM Agent Learning
por: Wang, Hanlin, et al.
Publicado: (2025)
por: Wang, Hanlin, et al.
Publicado: (2025)
Defense effectiveness across architectural layers: a mechanistic evaluation of persistent memory attacks on stateful LLM agents
por: Leong, Jun Wen
Publicado: (2026)
por: Leong, Jun Wen
Publicado: (2026)
Learning Off-policy with Model-based Intrinsic Motivation For Active Online Exploration
por: Wang, Yibo, et al.
Publicado: (2024)
por: Wang, Yibo, et al.
Publicado: (2024)
To Call or Not to Call: Diagnosing Intrinsic Over-Calling Bias in LLM Agents
por: Shi, Wei, et al.
Publicado: (2026)
por: Shi, Wei, et al.
Publicado: (2026)
TrajAware: Graph Cross-Attention and Trajectory-Aware for Generalisable VANETs under Partial Observations
por: Fu, Xiaolu, et al.
Publicado: (2025)
por: Fu, Xiaolu, et al.
Publicado: (2025)
Concealed Adversarial attacks on neural networks for sequential data
por: Sokerin, Petr, et al.
Publicado: (2025)
por: Sokerin, Petr, et al.
Publicado: (2025)
AVA-Bench: Atomic Visual Ability Benchmark for Vision Foundation Models
por: Mai, Zheda, et al.
Publicado: (2025)
por: Mai, Zheda, et al.
Publicado: (2025)
Prune-OPD: Efficient and Reliable On-Policy Distillation for Long-Horizon Reasoning
por: Yang, Zhicheng, et al.
Publicado: (2026)
por: Yang, Zhicheng, et al.
Publicado: (2026)
Verifier-Free RL for LLMs via Intrinsic Gradient-Norm Reward
por: Wen, Xuexiang, et al.
Publicado: (2026)
por: Wen, Xuexiang, et al.
Publicado: (2026)
Intra-Trajectory Consistency for Reward Modeling
por: Zhou, Chaoyang, et al.
Publicado: (2025)
por: Zhou, Chaoyang, et al.
Publicado: (2025)
Harnesses for Inference-Time Alignment over Execution Trajectories
por: Wang, Boyuan, et al.
Publicado: (2026)
por: Wang, Boyuan, et al.
Publicado: (2026)
Efficient Reinforcement Learning for Large Language Models with Intrinsic Exploration
por: Sun, Yan, et al.
Publicado: (2025)
por: Sun, Yan, et al.
Publicado: (2025)
λ: A Benchmark for Data-Efficiency in Long-Horizon Indoor Mobile Manipulation Robotics
por: Jaafar, Ahmed, et al.
Publicado: (2024)
por: Jaafar, Ahmed, et al.
Publicado: (2024)
Fixed-point graph convolutional networks against adversarial attacks
por: Khan, Shakib, et al.
Publicado: (2025)
por: Khan, Shakib, et al.
Publicado: (2025)
CityTrajBench: A Unified Benchmark for City-Scale Vehicle Trajectory Generation
por: Zhu, Shibo, et al.
Publicado: (2026)
por: Zhu, Shibo, et al.
Publicado: (2026)
Curiosity-Critic: Cumulative Prediction Error Improvement as a Tractable Intrinsic Reward for World Model Training
por: Bhaskara, Vin, et al.
Publicado: (2026)
por: Bhaskara, Vin, et al.
Publicado: (2026)
FedAGHN: Personalized Federated Learning with Attentive Graph HyperNetworks
por: Song, Jiarui, et al.
Publicado: (2025)
por: Song, Jiarui, et al.
Publicado: (2025)
McCast: Memory-Guided Latent Drift Correction for Long-Horizon Precipitation Nowcasting
por: Wen, Penghui, et al.
Publicado: (2026)
por: Wen, Penghui, et al.
Publicado: (2026)
GHQ: Grouped Hybrid Q Learning for Heterogeneous Cooperative Multi-agent Reinforcement Learning
por: Yu, Xiaoyang, et al.
Publicado: (2023)
por: Yu, Xiaoyang, et al.
Publicado: (2023)
Rooted Absorbed Prefix Trajectory Balance with Submodular Replay for GFlowNet Training
por: Wang, Xi, et al.
Publicado: (2026)
por: Wang, Xi, et al.
Publicado: (2026)
TRACE: Trajectory Recovery with State Propagation Diffusion for Urban Mobility
por: Wang, Jinming, et al.
Publicado: (2026)
por: Wang, Jinming, et al.
Publicado: (2026)
TrajWeaver: Trajectory Recovery with State Propagation Diffusion Model
por: Wang, Jinming, et al.
Publicado: (2024)
por: Wang, Jinming, et al.
Publicado: (2024)
Aligning LLM agents with human learning and adjustment behavior: a dual agent approach
por: Liu, Tianming, et al.
Publicado: (2025)
por: Liu, Tianming, et al.
Publicado: (2025)
Enhancing Noise Robustness of Parkinson's Disease Telemonitoring via Contrastive Feature Augmentation
por: Tang, Ziming, et al.
Publicado: (2025)
por: Tang, Ziming, et al.
Publicado: (2025)
Task Assignment and Exploration Optimization for Low Altitude UAV Rescue via Generative AI Enhanced Multi-agent Reinforcement Learning
por: Tang, Xin, et al.
Publicado: (2025)
por: Tang, Xin, et al.
Publicado: (2025)
Deep generative models as an adversarial attack strategy for tabular machine learning
por: Dyrmishi, Salijona, et al.
Publicado: (2024)
por: Dyrmishi, Salijona, et al.
Publicado: (2024)
Ejemplares similares
-
Safety-Utility Conflicts Are Not Global: Surgical Alignment via Head-Level Diagnosis
por: Cai, Wang, et al.
Publicado: (2026) -
Intrinsic Credit Assignment for Long Horizon Interaction
por: Auzina, Ilze Amanda, et al.
Publicado: (2026) -
A Non-autoregressive Multi-Horizon Flight Trajectory Prediction Framework with Gray Code Representation
por: Guo, Dongyue, et al.
Publicado: (2023) -
LiveClin: A Live Clinical Benchmark without Leakage
por: Wang, Xidong, et al.
Publicado: (2026) -
TRIP-Bench: A Benchmark for Long-Horizon Interactive Agents in Real-World Scenarios
por: Shen, Yuanzhe, et al.
Publicado: (2026)