Many-Tier Instruction Hierarchy in LLM Agents
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Zhang, Jingyu, Li, Tianjian, Jurayj, William, Zhan, Hongyuan, Van Durme, Benjamin, Khashabi, Daniel |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Language Models and Logic Programs for Trustworthy Tax Reasoning
par: Jurayj, William, et autres
Publié: (2025)
par: Jurayj, William, et autres
Publié: (2025)
Controllable Safety Alignment: Inference-Time Adaptation to Diverse Safety Requirements
par: Zhang, Jingyu, et autres
Publié: (2024)
par: Zhang, Jingyu, et autres
Publié: (2024)
Crystal: Characterizing Relative Impact of Scholarly Publications
par: Collison, Hannah, et autres
Publié: (2026)
par: Collison, Hannah, et autres
Publié: (2026)
Verifiable by Design: Aligning Language Models to Quote from Pre-Training Data
par: Zhang, Jingyu, et autres
Publié: (2024)
par: Zhang, Jingyu, et autres
Publié: (2024)
SELF-[IN]CORRECT: LLMs Struggle with Discriminating Self-Generated Responses
par: Jiang, Dongwei, et autres
Publié: (2024)
par: Jiang, Dongwei, et autres
Publié: (2024)
RATIONALYST: Mining Implicit Rationales for Process Supervision of Reasoning
par: Jiang, Dongwei, et autres
Publié: (2024)
par: Jiang, Dongwei, et autres
Publié: (2024)
"According to ...": Prompting Language Models Improves Quoting from Pre-Training Data
par: Weller, Orion, et autres
Publié: (2023)
par: Weller, Orion, et autres
Publié: (2023)
Certified Mitigation of Worst-Case LLM Copyright Infringement
par: Zhang, Jingyu, et autres
Publié: (2025)
par: Zhang, Jingyu, et autres
Publié: (2025)
Is That Your Final Answer? Test-Time Scaling Improves Selective Question Answering
par: Jurayj, William, et autres
Publié: (2025)
par: Jurayj, William, et autres
Publié: (2025)
LM Agents for Coordinating Multi-User Information Gathering
par: Jhamtani, Harsh, et autres
Publié: (2025)
par: Jhamtani, Harsh, et autres
Publié: (2025)
Tur[k]ingBench: A Challenge Benchmark for Web Agents
par: Xu, Kevin, et autres
Publié: (2024)
par: Xu, Kevin, et autres
Publié: (2024)
Can Coding Agents Reproduce Findings in Computational Materials Science?
par: Huang, Ziyang, et autres
Publié: (2026)
par: Huang, Ziyang, et autres
Publié: (2026)
Are Finer Citations Always Better? Rethinking Granularity for Attributed Generation
par: Wang, Hexuan, et autres
Publié: (2026)
par: Wang, Hexuan, et autres
Publié: (2026)
SEQR: Secure and Efficient QR-based LoRA Routing
par: Fleshman, William, et autres
Publié: (2025)
par: Fleshman, William, et autres
Publié: (2025)
LoRA-Augmented Generation (LAG) for Knowledge-Intensive Language Tasks
par: Fleshman, William, et autres
Publié: (2025)
par: Fleshman, William, et autres
Publié: (2025)
RE-Adapt: Reverse Engineered Adaptation of Large Language Models
par: Fleshman, William, et autres
Publié: (2024)
par: Fleshman, William, et autres
Publié: (2024)
SpectR: Dynamically Composing LM Experts with Spectral Routing
par: Fleshman, William, et autres
Publié: (2025)
par: Fleshman, William, et autres
Publié: (2025)
WorldAPIs: The World Is Worth How Many APIs? A Thought Experiment
par: Ou, Jiefu, et autres
Publié: (2024)
par: Ou, Jiefu, et autres
Publié: (2024)
Compactor: Calibrated Query-Agnostic KV Cache Compression with Approximate Leverage Scores
par: Chari, Vivek, et autres
Publié: (2025)
par: Chari, Vivek, et autres
Publié: (2025)
RE-AdaptIR: Improving Information Retrieval through Reverse Engineered Adaptation
par: Fleshman, William, et autres
Publié: (2024)
par: Fleshman, William, et autres
Publié: (2024)
Interpreting User Requests in the Context of Natural Language Standing Instructions
par: Moghe, Nikita, et autres
Publié: (2023)
par: Moghe, Nikita, et autres
Publié: (2023)
KV-Distill: Nearly Lossless Learnable Context Compression for LLMs
par: Chari, Vivek, et autres
Publié: (2025)
par: Chari, Vivek, et autres
Publié: (2025)
The Alignment Waltz: Jointly Training Agents to Collaborate for Safety
par: Zhang, Jingyu, et autres
Publié: (2025)
par: Zhang, Jingyu, et autres
Publié: (2025)
SIMPLEMIX: Frustratingly Simple Mixing of Off- and On-policy Data in Language Model Preference Learning
par: Li, Tianjian, et autres
Publié: (2025)
par: Li, Tianjian, et autres
Publié: (2025)
Process Supervision of Confidence Margin for Calibrated LLM Reasoning
par: Wang, Liaoyaqi, et autres
Publié: (2026)
par: Wang, Liaoyaqi, et autres
Publié: (2026)
It's Not the Capability: Harness Sensitivity Is Non-Monotone Across LLM Agent Tiers
par: Cho, Yong-eun
Publié: (2026)
par: Cho, Yong-eun
Publié: (2026)
Sample-Efficient Online Learning in LM Agents via Hindsight Trajectory Rewriting
par: Hu, Michael Y., et autres
Publié: (2025)
par: Hu, Michael Y., et autres
Publié: (2025)
AdapterSwap: Continuous Training of LLMs with Data Removal and Access-Control Guarantees
par: Fleshman, William, et autres
Publié: (2024)
par: Fleshman, William, et autres
Publié: (2024)
DeonticBench: A Benchmark for Reasoning over Rules
par: Dou, Guangyao, et autres
Publié: (2026)
par: Dou, Guangyao, et autres
Publié: (2026)
Instructional Segment Embedding: Improving LLM Safety with Instruction Hierarchy
par: Wu, Tong, et autres
Publié: (2024)
par: Wu, Tong, et autres
Publié: (2024)
Reframing Tax Law Entailment as Analogical Reasoning
par: Zou, Xinrui, et autres
Publié: (2024)
par: Zou, Xinrui, et autres
Publié: (2024)
Conformal Thinking: Risk Control for Reasoning on a Compute Budget
par: Wang, Xi, et autres
Publié: (2026)
par: Wang, Xi, et autres
Publié: (2026)
MICE for CATs: Model-Internal Confidence Estimation for Calibrating Agents with Tools
par: Subramani, Nishant, et autres
Publié: (2025)
par: Subramani, Nishant, et autres
Publié: (2025)
Control Illusion: The Failure of Instruction Hierarchies in Large Language Models
par: Geng, Yilin, et autres
Publié: (2025)
par: Geng, Yilin, et autres
Publié: (2025)
arXiv2Table: Toward Realistic Benchmarking and Evaluation for LLM-Based Literature-Review Table Generation
par: Wang, Weiqi, et autres
Publié: (2025)
par: Wang, Weiqi, et autres
Publié: (2025)
Always Tell Me The Odds: Fine-grained Conditional Probability Estimation
par: Wang, Liaoyaqi, et autres
Publié: (2025)
par: Wang, Liaoyaqi, et autres
Publié: (2025)
The Language Barrier: Dissecting Safety Challenges of LLMs in Multilingual Contexts
par: Shen, Lingfeng, et autres
Publié: (2024)
par: Shen, Lingfeng, et autres
Publié: (2024)
Weird Generalization is Weirdly Brittle
par: Wanner, Miriam, et autres
Publié: (2026)
par: Wanner, Miriam, et autres
Publié: (2026)
Star-Agents: Automatic Data Optimization with LLM Agents for Instruction Tuning
par: Zhou, Hang, et autres
Publié: (2024)
par: Zhou, Hang, et autres
Publié: (2024)
MultiMUC: Multilingual Template Filling on MUC-4
par: Gantt, William, et autres
Publié: (2024)
par: Gantt, William, et autres
Publié: (2024)
Documents similaires
-
Language Models and Logic Programs for Trustworthy Tax Reasoning
par: Jurayj, William, et autres
Publié: (2025) -
Controllable Safety Alignment: Inference-Time Adaptation to Diverse Safety Requirements
par: Zhang, Jingyu, et autres
Publié: (2024) -
Crystal: Characterizing Relative Impact of Scholarly Publications
par: Collison, Hannah, et autres
Publié: (2026) -
Verifiable by Design: Aligning Language Models to Quote from Pre-Training Data
par: Zhang, Jingyu, et autres
Publié: (2024) -
SELF-[IN]CORRECT: LLMs Struggle with Discriminating Self-Generated Responses
par: Jiang, Dongwei, et autres
Publié: (2024)