Harnesses for Inference-Time Alignment over Execution Trajectories
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Wang, Boyuan, Li, Bochao, Wang, Minghan, Tao, Yuxin, Kong, Fang |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Reward Shaping for Inference-Time Alignment: A Stackelberg Game Perspective
par: Wang, Haichuan, et autres
Publié: (2026)
par: Wang, Haichuan, et autres
Publié: (2026)
Learnable Chernoff Baselines for Inference-Time Alignment
par: Madhow, Sunil, et autres
Publié: (2026)
par: Madhow, Sunil, et autres
Publié: (2026)
Predictive Inference With Fast Feature Conformal Prediction
par: Tang, Zihao, et autres
Publié: (2024)
par: Tang, Zihao, et autres
Publié: (2024)
Inference-Time Alignment of Diffusion Models with Direct Noise Optimization
par: Tang, Zhiwei, et autres
Publié: (2024)
par: Tang, Zhiwei, et autres
Publié: (2024)
Dynamic Search for Inference-Time Alignment in Diffusion Models
par: Li, Xiner, et autres
Publié: (2025)
par: Li, Xiner, et autres
Publié: (2025)
IterIS: Iterative Inference-Solving Alignment for LoRA Merging
par: Chen, Hongxu, et autres
Publié: (2024)
par: Chen, Hongxu, et autres
Publié: (2024)
Revisiting the (Sub)Optimality of Best-of-N for Inference-Time Alignment
par: Sriraman, Ved, et autres
Publié: (2026)
par: Sriraman, Ved, et autres
Publié: (2026)
Best-of-Tails: Bridging Optimism and Pessimism in Inference-Time Alignment
par: Hsu, Hsiang, et autres
Publié: (2026)
par: Hsu, Hsiang, et autres
Publié: (2026)
When Tables Leak: Attacking String Memorization in LLM-Based Tabular Data Generation
par: Ward, Joshua, et autres
Publié: (2025)
par: Ward, Joshua, et autres
Publié: (2025)
REPLAY: Modeling Time-Varying Temporal Regularities of Human Mobility for Location Prediction over Sparse Trajectories
par: Deng, Bangchao, et autres
Publié: (2024)
par: Deng, Bangchao, et autres
Publié: (2024)
Inference-Time Alignment in Diffusion Models with Reward-Guided Generation: Tutorial and Review
par: Uehara, Masatoshi, et autres
Publié: (2025)
par: Uehara, Masatoshi, et autres
Publié: (2025)
Pref-GUIDE: Continual Policy Learning from Real-Time Human Feedback via Preference-Based Learning
par: Ji, Zhengran, et autres
Publié: (2025)
par: Ji, Zhengran, et autres
Publié: (2025)
Inference-Time Alignment Control for Diffusion Models with Reinforcement Learning Guidance
par: Jin, Luozhijie, et autres
Publié: (2025)
par: Jin, Luozhijie, et autres
Publié: (2025)
Temper and Tilt Lead to SLOP: Reward Hacking Mitigation with Inference-Time Alignment
par: Wang, Ye, et autres
Publié: (2026)
par: Wang, Ye, et autres
Publié: (2026)
Is Best-of-N the Best of Them? Coverage, Scaling, and Optimality in Inference-Time Alignment
par: Huang, Audrey, et autres
Publié: (2025)
par: Huang, Audrey, et autres
Publié: (2025)
Self-ReSET: Learning to Self-Recover from Unsafe Reasoning Trajectories
par: Zhang, Dongcheng, et autres
Publié: (2026)
par: Zhang, Dongcheng, et autres
Publié: (2026)
DDGAD: Trajectory Dynamics for Diffusion-Based Graph Anomaly Detection
par: Yang, Yuxin, et autres
Publié: (2026)
par: Yang, Yuxin, et autres
Publié: (2026)
MAESTRO: Multi-Agent Environment Shaping through Task and Reward Optimization
par: Wu, Boyuan
Publié: (2025)
par: Wu, Boyuan
Publié: (2025)
HARBOR: Automated Harness Optimization
par: Sengupta, Biswa, et autres
Publié: (2026)
par: Sengupta, Biswa, et autres
Publié: (2026)
DeeR-VLA: Dynamic Inference of Multimodal Large Language Models for Efficient Robot Execution
par: Yue, Yang, et autres
Publié: (2024)
par: Yue, Yang, et autres
Publié: (2024)
Learning Privacy-Preserving Student Networks via Discriminative-Generative Distillation
par: Ge, Shiming, et autres
Publié: (2024)
par: Ge, Shiming, et autres
Publié: (2024)
A Machine Learning-Based Multimodal Framework for Wearable Sensor-Based Archery Action Recognition and Stress Estimation
par: Liu, Xianghe, et autres
Publié: (2025)
par: Liu, Xianghe, et autres
Publié: (2025)
Intra-Trajectory Consistency for Reward Modeling
par: Zhou, Chaoyang, et autres
Publié: (2025)
par: Zhou, Chaoyang, et autres
Publié: (2025)
DDTime: Dataset Distillation with Spectral Alignment and Information Bottleneck for Time-Series Forecasting
par: Li, Yuqi, et autres
Publié: (2025)
par: Li, Yuqi, et autres
Publié: (2025)
Reasoning Language Model Inference Serving Unveiled: An Empirical Study
par: Li, Qi, et autres
Publié: (2025)
par: Li, Qi, et autres
Publié: (2025)
Hyperparameter Trajectory Inference with Conditional Lagrangian Optimal Transport
par: Amad, Harry, et autres
Publié: (2026)
par: Amad, Harry, et autres
Publié: (2026)
TreeBoN: Enhancing Inference-Time Alignment with Speculative Tree-Search and Best-of-N Sampling
par: Qiu, Jiahao, et autres
Publié: (2024)
par: Qiu, Jiahao, et autres
Publié: (2024)
Logic-Guided Multistage Inference for Explainable Multidefendant Judgment Prediction
par: Zhang, Xu, et autres
Publié: (2026)
par: Zhang, Xu, et autres
Publié: (2026)
Aggregation Alignment for Federated Learning with Mixture-of-Experts under Data Heterogeneity
par: Fang, Zihan, et autres
Publié: (2026)
par: Fang, Zihan, et autres
Publié: (2026)
A Practical Approach to Causal Inference over Time
par: Cinquini, Martina, et autres
Publié: (2024)
par: Cinquini, Martina, et autres
Publié: (2024)
Immune: Improving Safety Against Jailbreaks in Multi-modal LLMs via Inference-Time Alignment
par: Ghosal, Soumya Suvra, et autres
Publié: (2024)
par: Ghosal, Soumya Suvra, et autres
Publié: (2024)
PITA: Preference-Guided Inference-Time Alignment for LLM Post-Training
par: Bobbili, Sarat Chandra, et autres
Publié: (2025)
par: Bobbili, Sarat Chandra, et autres
Publié: (2025)
Every Rollout Counts: Optimal Resource Allocation for Efficient Test-Time Scaling
par: Wang, Xinglin, et autres
Publié: (2025)
par: Wang, Xinglin, et autres
Publié: (2025)
DistDF: Time-Series Forecasting Needs Joint-Distribution Wasserstein Alignment
par: Wang, Hao, et autres
Publié: (2025)
par: Wang, Hao, et autres
Publié: (2025)
Catastrophic Forgetting in Kolmogorov-Arnold Networks
par: Rahman, Mohammad Marufur, et autres
Publié: (2025)
par: Rahman, Mohammad Marufur, et autres
Publié: (2025)
Inference-Time Code Selection via Symbolic Equivalence Partitioning
par: Cho, David, et autres
Publié: (2026)
par: Cho, David, et autres
Publié: (2026)
DFA-GNN: Forward Learning of Graph Neural Networks by Direct Feedback Alignment
par: Zhao, Gongpei, et autres
Publié: (2024)
par: Zhao, Gongpei, et autres
Publié: (2024)
Harnessing Agentic Evolution
par: Zhang, Jiayi, et autres
Publié: (2026)
par: Zhang, Jiayi, et autres
Publié: (2026)
Lie Neurons: Adjoint-Equivariant Neural Networks for Semisimple Lie Algebras
par: Lin, Tzu-Yuan, et autres
Publié: (2023)
par: Lin, Tzu-Yuan, et autres
Publié: (2023)
Beyond Reward Hacking: Causal Rewards for Large Language Model Alignment
par: Wang, Chaoqi, et autres
Publié: (2025)
par: Wang, Chaoqi, et autres
Publié: (2025)
Documents similaires
-
Reward Shaping for Inference-Time Alignment: A Stackelberg Game Perspective
par: Wang, Haichuan, et autres
Publié: (2026) -
Learnable Chernoff Baselines for Inference-Time Alignment
par: Madhow, Sunil, et autres
Publié: (2026) -
Predictive Inference With Fast Feature Conformal Prediction
par: Tang, Zihao, et autres
Publié: (2024) -
Inference-Time Alignment of Diffusion Models with Direct Noise Optimization
par: Tang, Zhiwei, et autres
Publié: (2024) -
Dynamic Search for Inference-Time Alignment in Diffusion Models
par: Li, Xiner, et autres
Publié: (2025)