Phi: Preference Hijacking in Multi-modal Large Language Models at Inference Time
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Lan, Yifan, Cao, Yuanpu, Zhang, Weitong, Lin, Lu, Chen, Jinghui |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Personalized Steering of Large Language Models: Versatile Steering Vectors Through Bi-directional Preference Optimization
par: Cao, Yuanpu, et autres
Publié: (2024)
par: Cao, Yuanpu, et autres
Publié: (2024)
The Illusion of Reasoning: Exposing Evasive Data Contamination in LLMs via Zero-CoT Truncation
par: Lan, Yifan, et autres
Publié: (2026)
par: Lan, Yifan, et autres
Publié: (2026)
Adversarially Robust Industrial Anomaly Detection Through Diffusion Model
par: Cao, Yuanpu, et autres
Publié: (2024)
par: Cao, Yuanpu, et autres
Publié: (2024)
ParaBlock: Communication-Computation Parallel Block Coordinate Federated Learning for Large Language Models
par: Wang, Yujia, et autres
Publié: (2025)
par: Wang, Yujia, et autres
Publié: (2025)
Defending Against Alignment-Breaking Attacks via Robustly Aligned LLM
par: Cao, Bochuan, et autres
Publié: (2023)
par: Cao, Bochuan, et autres
Publié: (2023)
ForecastCompass: Guiding Agentic Forecasting with Adaptive Factor Memory
par: Chang, Yurui, et autres
Publié: (2026)
par: Chang, Yurui, et autres
Publié: (2026)
WordGame: Efficient & Effective LLM Jailbreak via Simultaneous Obfuscation in Query and Response
par: Zhang, Tianrong, et autres
Publié: (2024)
par: Zhang, Tianrong, et autres
Publié: (2024)
TruthFlow: Truthful LLM Generation via Representation Flow Correction
par: Wang, Hanyu, et autres
Publié: (2025)
par: Wang, Hanyu, et autres
Publié: (2025)
Restoring the Sweet Spot: Pass-Rate Weighted Self-Distillation for LLM Reasoning
par: Liu, Zehao, et autres
Publié: (2026)
par: Liu, Zehao, et autres
Publié: (2026)
JoPA:Explaining Large Language Model's Generation via Joint Prompt Attribution
par: Chang, Yurui, et autres
Publié: (2024)
par: Chang, Yurui, et autres
Publié: (2024)
PreFlect: From Retrospective to Prospective Reflection in Large Language Model Agents
par: Wang, Hanyu, et autres
Publié: (2026)
par: Wang, Hanyu, et autres
Publié: (2026)
Stealthy and Persistent Unalignment on Large Language Models via Backdoor Injections
par: Cao, Yuanpu, et autres
Publié: (2023)
par: Cao, Yuanpu, et autres
Publié: (2023)
StreamPhy: Streaming Inference of High-Dimensional Physical Dynamics via State Space Models
par: Chen, Panqi, et autres
Publié: (2026)
par: Chen, Panqi, et autres
Publié: (2026)
Understanding Why Large Language Models Can Be Ineffective in Time Series Analysis: The Impact of Modality Alignment
par: Zheng, Liangwei Nathan, et autres
Publié: (2024)
par: Zheng, Liangwei Nathan, et autres
Publié: (2024)
Tree-Structured Synergy of Large Language Models and Bayesian Optimization for Efficient CASH
par: Xu, Beicheng, et autres
Publié: (2026)
par: Xu, Beicheng, et autres
Publié: (2026)
Fisher Random Walk: Automatic Debiasing Contextual Preference Inference for Large Language Model Evaluation
par: Zhang, Yichi, et autres
Publié: (2025)
par: Zhang, Yichi, et autres
Publié: (2025)
Rephrase and Respond: Let Large Language Models Ask Better Questions for Themselves
par: Deng, Yihe, et autres
Publié: (2023)
par: Deng, Yihe, et autres
Publié: (2023)
Hijacking Large Language Models via Adversarial In-Context Learning
par: Zhou, Xiangyu, et autres
Publié: (2023)
par: Zhou, Xiangyu, et autres
Publié: (2023)
Connector-S: A Survey of Connectors in Multi-modal Large Language Models
par: Zhu, Xun, et autres
Publié: (2025)
par: Zhu, Xun, et autres
Publié: (2025)
Learning to Select In-Context Demonstration Preferred by Large Language Model
par: Zhang, Zheng, et autres
Publié: (2025)
par: Zhang, Zheng, et autres
Publié: (2025)
Model Hijacking Attack in Federated Learning
par: Li, Zheng, et autres
Publié: (2024)
par: Li, Zheng, et autres
Publié: (2024)
Multi-modal Preference Alignment Remedies Degradation of Visual Instruction Tuning on Language Models
par: Li, Shengzhi, et autres
Publié: (2024)
par: Li, Shengzhi, et autres
Publié: (2024)
CITER: Collaborative Inference for Efficient Large Language Model Decoding with Token-Level Routing
par: Zheng, Wenhao, et autres
Publié: (2025)
par: Zheng, Wenhao, et autres
Publié: (2025)
Inference-Time Reward Hacking in Large Language Models
par: Khalaf, Hadi, et autres
Publié: (2025)
par: Khalaf, Hadi, et autres
Publié: (2025)
Multi-Reference Preference Optimization for Large Language Models
par: Le, Hung, et autres
Publié: (2024)
par: Le, Hung, et autres
Publié: (2024)
Inference of Utilities and Time Preference in Sequential Decision-Making
par: Cao, Haoyang, et autres
Publié: (2024)
par: Cao, Haoyang, et autres
Publié: (2024)
Discovering Preference Optimization Algorithms with and for Large Language Models
par: Lu, Chris, et autres
Publié: (2024)
par: Lu, Chris, et autres
Publié: (2024)
On the Robustness of Transformers against Context Hijacking for Linear Classification
par: Li, Tianle, et autres
Publié: (2025)
par: Li, Tianle, et autres
Publié: (2025)
Online Preference-based Reinforcement Learning with Self-augmented Feedback from Large Language Model
par: Tu, Songjun, et autres
Publié: (2024)
par: Tu, Songjun, et autres
Publié: (2024)
AXIS: Explainable Time Series Anomaly Detection with Large Language Models
par: Lan, Tian, et autres
Publié: (2025)
par: Lan, Tian, et autres
Publié: (2025)
PhySense: Principle-Based Physics Reasoning Benchmarking for Large Language Models
par: Xu, Yinggan, et autres
Publié: (2025)
par: Xu, Yinggan, et autres
Publié: (2025)
CATTO: Balancing Preferences and Confidence in Language Models
par: Parikh, Nisarg, et autres
Publié: (2026)
par: Parikh, Nisarg, et autres
Publié: (2026)
On the Comparison between Multi-modal and Single-modal Contrastive Learning
par: Huang, Wei, et autres
Publié: (2024)
par: Huang, Wei, et autres
Publié: (2024)
AdditiveLLM2: A Multi-modal Large Language Model for Additive Manufacturing
par: Pak, Peter, et autres
Publié: (2026)
par: Pak, Peter, et autres
Publié: (2026)
Optimizing Language Models for Human Preferences is a Causal Inference Problem
par: Lin, Victoria, et autres
Publié: (2024)
par: Lin, Victoria, et autres
Publié: (2024)
AutoRAN: Automated Hijacking of Safety Reasoning in Large Reasoning Models
par: Liang, Jiacheng, et autres
Publié: (2025)
par: Liang, Jiacheng, et autres
Publié: (2025)
Osmosis Distillation: Model Hijacking with the Fewest Samples
par: Shi, Yuchen, et autres
Publié: (2026)
par: Shi, Yuchen, et autres
Publié: (2026)
SCORPIO: Serving the Right Requests at the Right Time for Heterogeneous SLOs in LLM Inference
par: Tang, Yinghao, et autres
Publié: (2025)
par: Tang, Yinghao, et autres
Publié: (2025)
Customize Multi-modal RAI Guardrails with Precedent-based predictions
par: Yang, Cheng-Fu, et autres
Publié: (2025)
par: Yang, Cheng-Fu, et autres
Publié: (2025)
Regurgitative Training: The Value of Real Data in Training Large Language Models
par: Zhang, Jinghui, et autres
Publié: (2024)
par: Zhang, Jinghui, et autres
Publié: (2024)
Documents similaires
-
Personalized Steering of Large Language Models: Versatile Steering Vectors Through Bi-directional Preference Optimization
par: Cao, Yuanpu, et autres
Publié: (2024) -
The Illusion of Reasoning: Exposing Evasive Data Contamination in LLMs via Zero-CoT Truncation
par: Lan, Yifan, et autres
Publié: (2026) -
Adversarially Robust Industrial Anomaly Detection Through Diffusion Model
par: Cao, Yuanpu, et autres
Publié: (2024) -
ParaBlock: Communication-Computation Parallel Block Coordinate Federated Learning for Large Language Models
par: Wang, Yujia, et autres
Publié: (2025) -
Defending Against Alignment-Breaking Attacks via Robustly Aligned LLM
par: Cao, Bochuan, et autres
Publié: (2023)