Inference-time Alignment via Sparse Junction Steering
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Hu, Runyi, Zhang, Jie, Zhao, Shiqian, Meng, Jiale, Li, Jiwei, Zeng, Jason, Wu, Ming, Heinrich, Michael, Wen, Yonggang, Zhang, Tianwei |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Mask Image Watermarking
par: Hu, Runyi, et autres
Publié: (2025)
par: Hu, Runyi, et autres
Publié: (2025)
Unifying Watermarking via Dimension-Aware Mapping
par: Meng, Jiale, et autres
Publié: (2026)
par: Meng, Jiale, et autres
Publié: (2026)
TRACE: Structure-Aware Character Encoding for Robust and Generalizable Document Watermarking
par: Meng, Jiale, et autres
Publié: (2026)
par: Meng, Jiale, et autres
Publié: (2026)
Robust-Wide: Robust Watermarking against Instruction-driven Image Editing
par: Hu, Runyi, et autres
Publié: (2024)
par: Hu, Runyi, et autres
Publié: (2024)
VideoShield: Regulating Diffusion-based Video Generation Models via Watermarking
par: Hu, Runyi, et autres
Publié: (2025)
par: Hu, Runyi, et autres
Publié: (2025)
SuperMark: Robust and Training-free Image Watermarking via Diffusion-based Super-Resolution
par: Hu, Runyi, et autres
Publié: (2024)
par: Hu, Runyi, et autres
Publié: (2024)
SAME: Sample Reconstruction against Model Extraction Attacks
par: Xie, Yi, et autres
Publié: (2023)
par: Xie, Yi, et autres
Publié: (2023)
Reinforcement Learning Enhanced LLMs: A Survey
par: Wang, Shuhe, et autres
Publié: (2024)
par: Wang, Shuhe, et autres
Publié: (2024)
TorchGT: A Holistic System for Large-scale Graph Transformer Training
par: Zhang, Meng, et autres
Publié: (2024)
par: Zhang, Meng, et autres
Publié: (2024)
When Memory Becomes a Vulnerability: Towards Multi-turn Jailbreak Attacks against Text-to-Image Generation Systems
par: Zhao, Shiqian, et autres
Publié: (2025)
par: Zhao, Shiqian, et autres
Publié: (2025)
InfraMind: A Novel Exploration-based GUI Agentic Framework for Mission-critical Industrial Management
par: Lin, Liangtao, et autres
Publié: (2025)
par: Lin, Liangtao, et autres
Publié: (2025)
DSB: Dynamic Sliding Block Scheduling for Diffusion LLMs
par: Luo, Lizhuo, et autres
Publié: (2026)
par: Luo, Lizhuo, et autres
Publié: (2026)
SOPRAG: Multi-view Graph Experts Retrieval for Industrial Standard Operating Procedures
par: Lin, Liangtao, et autres
Publié: (2026)
par: Lin, Liangtao, et autres
Publié: (2026)
Instruction Tuning for Large Language Models: A Survey
par: Zhang, Shengyu, et autres
Publié: (2023)
par: Zhang, Shengyu, et autres
Publié: (2023)
LAFR: Efficient Diffusion-based Blind Face Restoration via Latent Codebook Alignment Adapter
par: Li, Runyi, et autres
Publié: (2025)
par: Li, Runyi, et autres
Publié: (2025)
Visible Yet Unreadable: A Systematic Blind Spot of Vision Language Models Across Writing Systems
par: Zhang, Jie, et autres
Publié: (2025)
par: Zhang, Jie, et autres
Publié: (2025)
Picky LLMs and Unreliable RMs: An Empirical Study on Safety Alignment after Instruction Tuning
par: Li, Guanlin, et autres
Publié: (2025)
par: Li, Guanlin, et autres
Publié: (2025)
Mind Your HEARTBEAT! Claw Background Execution Inherently Enables Silent Memory Pollution
par: Zhang, Yechao, et autres
Publié: (2026)
par: Zhang, Yechao, et autres
Publié: (2026)
Three Minds, One Legend: Jailbreak Large Reasoning Model with Adaptive Stacked Ciphers
par: Nguyen, Viet-Anh, et autres
Publié: (2025)
par: Nguyen, Viet-Anh, et autres
Publié: (2025)
SPPO:Efficient Long-sequence LLM Training via Adaptive Sequence Pipeline Parallel Offloading
par: Chen, Qiaoling, et autres
Publié: (2025)
par: Chen, Qiaoling, et autres
Publié: (2025)
Mind the Cost of Scaffold! Benign Clients May Even Become Accomplices of Backdoor Attack
par: Han, Xingshuo, et autres
Publié: (2024)
par: Han, Xingshuo, et autres
Publié: (2024)
Efficient Fuzzy Private Set Intersection from Secret-shared OPRF
par: Yang, Xinpeng, et autres
Publié: (2026)
par: Yang, Xinpeng, et autres
Publié: (2026)
Rethinking Key-Value Cache Compression Techniques for Large Language Model Serving
par: Gao, Wei, et autres
Publié: (2025)
par: Gao, Wei, et autres
Publié: (2025)
PromptTuner: SLO-Aware Elastic System for LLM Prompt Tuning
par: Gao, Wei, et autres
Publié: (2026)
par: Gao, Wei, et autres
Publié: (2026)
CONCUR: High-Throughput Agentic Batch Inference of LLM via Congestion-Based Concurrency Control
par: Chen, Qiaoling, et autres
Publié: (2026)
par: Chen, Qiaoling, et autres
Publié: (2026)
SparseDVFS: Sparse-Aware DVFS for Energy-Efficient Edge Inference
par: Zhang, Ziyang, et autres
Publié: (2026)
par: Zhang, Ziyang, et autres
Publié: (2026)
Iterative Inference-time Scaling with Adaptive Frequency Steering for Image Super-Resolution
par: Zhang, Hexin, et autres
Publié: (2025)
par: Zhang, Hexin, et autres
Publié: (2025)
Exploring Diverse Generation Paths via Inference-time Stiefel Activation Steering
par: Zhu, Dongxuan, et autres
Publié: (2026)
par: Zhu, Dongxuan, et autres
Publié: (2026)
Robust and Reversible Thermal/Electro‐Responsive Supramolecular Polymeric Adhesives via Synergistic Hydrogen‐Bonds and Ionic Junctions
par: Qizhe Deng, et autres
Publié: (2024)
par: Qizhe Deng, et autres
Publié: (2024)
Robust and Reversible Thermal/Electro‐Responsive Supramolecular Polymeric Adhesives via Synergistic Hydrogen‐Bonds and Ionic Junctions
par: Qizhe Deng, et autres
Publié: (2024)
par: Qizhe Deng, et autres
Publié: (2024)
CorrSteer: Generation-Time LLM Steering via Correlated Sparse Autoencoder Features
par: Cho, Seonglae, et autres
Publié: (2025)
par: Cho, Seonglae, et autres
Publié: (2025)
The Anatomy of Alignment: Decomposing Preference Optimization by Steering Sparse Features
par: Ferrao, Jeremias, et autres
Publié: (2025)
par: Ferrao, Jeremias, et autres
Publié: (2025)
Interpretable LLM Guardrails via Sparse Representation Steering
par: He, Zeqing, et autres
Publié: (2025)
par: He, Zeqing, et autres
Publié: (2025)
Semantic-Aware Scheduling for GPU Clusters with Large Language Models
par: Wang, Zerui, et autres
Publié: (2025)
par: Wang, Zerui, et autres
Publié: (2025)
InferDPT: Privacy-Preserving Inference for Closed-box Large Language Model
par: Tong, Meng, et autres
Publié: (2023)
par: Tong, Meng, et autres
Publié: (2023)
TouchGuide: Inference-Time Steering of Visuomotor Policies via Touch Guidance
par: Zhang, Zhemeng, et autres
Publié: (2026)
par: Zhang, Zhemeng, et autres
Publié: (2026)
FaithSteer-BENCH: A Deployment-Aligned Stress-Testing Benchmark for Inference-Time Steering
par: Ding, Zikang, et autres
Publié: (2026)
par: Ding, Zikang, et autres
Publié: (2026)
SteerRM: Debiasing Reward Models via Sparse Autoencoders
par: Sun, Mengyuan, et autres
Publié: (2026)
par: Sun, Mengyuan, et autres
Publié: (2026)
Energy-Efficient Thermal Comfort Control in Smart Buildings via Deep Reinforcement Learning
par: Gao, Guanyu, et autres
Publié: (2019)
par: Gao, Guanyu, et autres
Publié: (2019)
Latent Embedding Adaptation for Human Preference Alignment in Diffusion Planners
par: Ng, Wen Zheng Terence, et autres
Publié: (2025)
par: Ng, Wen Zheng Terence, et autres
Publié: (2025)
Documents similaires
-
Mask Image Watermarking
par: Hu, Runyi, et autres
Publié: (2025) -
Unifying Watermarking via Dimension-Aware Mapping
par: Meng, Jiale, et autres
Publié: (2026) -
TRACE: Structure-Aware Character Encoding for Robust and Generalizable Document Watermarking
par: Meng, Jiale, et autres
Publié: (2026) -
Robust-Wide: Robust Watermarking against Instruction-driven Image Editing
par: Hu, Runyi, et autres
Publié: (2024) -
VideoShield: Regulating Diffusion-based Video Generation Models via Watermarking
par: Hu, Runyi, et autres
Publié: (2025)