Salvato in:
| Autori principali: | Nguyen, Tuan, Tran-Thanh, Long |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | https://arxiv.org/abs/2510.09330 |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Black-Box Behavioral Distillation Breaks Safety Alignment in Medical LLMs
di: Jahan, Sohely, et al.
Pubblicazione: (2025)
di: Jahan, Sohely, et al.
Pubblicazione: (2025)
Curvature-Aware Safety Restoration In LLMs Fine-Tuning
di: Bach, Thong, et al.
Pubblicazione: (2025)
di: Bach, Thong, et al.
Pubblicazione: (2025)
CASUAL: Conditional Support Alignment for Domain Adaptation with Label Shift
di: Nguyen, Anh T, et al.
Pubblicazione: (2023)
di: Nguyen, Anh T, et al.
Pubblicazione: (2023)
Kernel Learning for Sample Constrained Black-Box Optimization
di: Rajagopalan, Rajalaxmi, et al.
Pubblicazione: (2025)
di: Rajagopalan, Rajalaxmi, et al.
Pubblicazione: (2025)
Continual Safety Alignment via Gradient-Based Sample Selection
di: Bach, Thong, et al.
Pubblicazione: (2026)
di: Bach, Thong, et al.
Pubblicazione: (2026)
Feature Optimization for Time Series Forecasting via Novel Randomized Uphill Climbing
di: Van Thanh, Nguyen
Pubblicazione: (2025)
di: Van Thanh, Nguyen
Pubblicazione: (2025)
BSO: Safety Alignment Is Density Ratio Matching
di: Nguyen, Tien-Phat, et al.
Pubblicazione: (2026)
di: Nguyen, Tien-Phat, et al.
Pubblicazione: (2026)
Sample-Constrained Black Box Optimization for Audio Personalization
di: Rajagopalan, Rajalaxmi, et al.
Pubblicazione: (2025)
di: Rajagopalan, Rajalaxmi, et al.
Pubblicazione: (2025)
Statistical Inference for Autoencoder-based Anomaly Detection after Representation Learning-based Domain Adaptation
di: Kiet, Tran Tuan, et al.
Pubblicazione: (2025)
di: Kiet, Tran Tuan, et al.
Pubblicazione: (2025)
Immune: Improving Safety Against Jailbreaks in Multi-modal LLMs via Inference-Time Alignment
di: Ghosal, Soumya Suvra, et al.
Pubblicazione: (2024)
di: Ghosal, Soumya Suvra, et al.
Pubblicazione: (2024)
POT: Inducing Overthinking in LLMs via Black-Box Iterative Optimization
di: Li, Xinyu, et al.
Pubblicazione: (2025)
di: Li, Xinyu, et al.
Pubblicazione: (2025)
Black Box Causal Inference: Effect Estimation via Meta Prediction
di: Bynum, Lucius E. J., et al.
Pubblicazione: (2025)
di: Bynum, Lucius E. J., et al.
Pubblicazione: (2025)
Black-Box Optimization From Small Offline Datasets via Meta Learning with Synthetic Tasks
di: Fadhel, Azza, et al.
Pubblicazione: (2026)
di: Fadhel, Azza, et al.
Pubblicazione: (2026)
PRESTO: Preimage-Informed Instruction Optimization for Prompting Black-Box LLMs
di: Chu, Jaewon, et al.
Pubblicazione: (2025)
di: Chu, Jaewon, et al.
Pubblicazione: (2025)
Mitigating the Safety Alignment Tax with Null-Space Constrained Policy Optimization
di: Niu, Yifan, et al.
Pubblicazione: (2025)
di: Niu, Yifan, et al.
Pubblicazione: (2025)
HUANet: Hard-Constrained Unrolled ADMM for Constrained Convex Optimization
di: Tran, Trinh, et al.
Pubblicazione: (2026)
di: Tran, Trinh, et al.
Pubblicazione: (2026)
No-Regret Learning of Nash Equilibrium for Black-Box Games via Gaussian Processes
di: Han, Minbiao, et al.
Pubblicazione: (2024)
di: Han, Minbiao, et al.
Pubblicazione: (2024)
MANATEE: Inference-Time Lightweight Diffusion Based Safety Defense for LLMs
di: Kan, Chun Yan Ryan, et al.
Pubblicazione: (2026)
di: Kan, Chun Yan Ryan, et al.
Pubblicazione: (2026)
Boundary Point Jailbreaking of Black-Box LLMs
di: Davies, Xander, et al.
Pubblicazione: (2026)
di: Davies, Xander, et al.
Pubblicazione: (2026)
Transferable Black-Box One-Shot Forging of Watermarks via Image Preference Models
di: Souček, Tomáš, et al.
Pubblicazione: (2025)
di: Souček, Tomáš, et al.
Pubblicazione: (2025)
Unveiling the Black Box: A Multi-Layer Framework for Explaining Reinforcement Learning-Based Cyber Agents
di: Goel, Diksha, et al.
Pubblicazione: (2025)
di: Goel, Diksha, et al.
Pubblicazione: (2025)
Surrogate-based Optimization via Clustering for Box-Constrained Problems
di: Ahmad, Maaz, et al.
Pubblicazione: (2026)
di: Ahmad, Maaz, et al.
Pubblicazione: (2026)
Posterior Inference in Latent Space for Scalable Constrained Black-box Optimization
di: Om, Kiyoung, et al.
Pubblicazione: (2025)
di: Om, Kiyoung, et al.
Pubblicazione: (2025)
Enhancing Time Series Forecasting via a Parallel Hybridization of ARIMA and Polynomial Classifiers
di: Nguyen, Thanh Son, et al.
Pubblicazione: (2025)
di: Nguyen, Thanh Son, et al.
Pubblicazione: (2025)
Stepwise Alignment for Constrained Language Model Policy Optimization
di: Wachi, Akifumi, et al.
Pubblicazione: (2024)
di: Wachi, Akifumi, et al.
Pubblicazione: (2024)
Evaluating Black-Box Vulnerabilities with Wasserstein-Constrained Data Perturbations
di: Monteiro, Adriana Laurindo, et al.
Pubblicazione: (2026)
di: Monteiro, Adriana Laurindo, et al.
Pubblicazione: (2026)
Efficient Mixture Learning in Black-Box Variational Inference
di: Hotti, Alexandra, et al.
Pubblicazione: (2024)
di: Hotti, Alexandra, et al.
Pubblicazione: (2024)
Robust SDE Parameter Estimation Under Missing Time Information Setting
di: Van Tran, Long, et al.
Pubblicazione: (2026)
di: Van Tran, Long, et al.
Pubblicazione: (2026)
Reward Shaping for Inference-Time Alignment: A Stackelberg Game Perspective
di: Wang, Haichuan, et al.
Pubblicazione: (2026)
di: Wang, Haichuan, et al.
Pubblicazione: (2026)
Revisiting LARS for Large Batch Training Generalization of Neural Networks
di: Do, Khoi, et al.
Pubblicazione: (2023)
di: Do, Khoi, et al.
Pubblicazione: (2023)
Learning the Expected Core of Strictly Convex Stochastic Cooperative Games
di: Tran, Nam Phuong, et al.
Pubblicazione: (2024)
di: Tran, Nam Phuong, et al.
Pubblicazione: (2024)
Hair-Trigger Alignment: Black-Box Evaluation Cannot Guarantee Post-Update Alignment
di: Bakman, Yavuz, et al.
Pubblicazione: (2026)
di: Bakman, Yavuz, et al.
Pubblicazione: (2026)
Agnostic Sharpness-Aware Minimization
di: Nguyen, Van-Anh, et al.
Pubblicazione: (2024)
di: Nguyen, Van-Anh, et al.
Pubblicazione: (2024)
On the Convergence of Black-Box Variational Inference
di: Kim, Kyurae, et al.
Pubblicazione: (2023)
di: Kim, Kyurae, et al.
Pubblicazione: (2023)
Auditing Training Data in Generative Music Models via Black-Box Membership Inference
di: Liu, Yi Chen, et al.
Pubblicazione: (2026)
di: Liu, Yi Chen, et al.
Pubblicazione: (2026)
Guardrails in Logit Space: Safety Token Regularization for LLM Alignment
di: Bach, Thong, et al.
Pubblicazione: (2026)
di: Bach, Thong, et al.
Pubblicazione: (2026)
Black Box Variational Inference with a Deterministic Objective: Faster, More Accurate, and Even More Black Box
di: Giordano, Ryan, et al.
Pubblicazione: (2023)
di: Giordano, Ryan, et al.
Pubblicazione: (2023)
Adaptive Test-Time Compute Allocation for Reasoning LLMs via Constrained Policy Optimization
di: Zhai, Zhiyuan, et al.
Pubblicazione: (2026)
di: Zhai, Zhiyuan, et al.
Pubblicazione: (2026)
Empirical Comparison of Lightweight Forecasting Models for Seasonal and Non-Seasonal Time Series
di: Nguyen, Thanh Son, et al.
Pubblicazione: (2025)
di: Nguyen, Thanh Son, et al.
Pubblicazione: (2025)
GLiRA: Black-Box Membership Inference Attack via Knowledge Distillation
di: Galichin, Andrey V., et al.
Pubblicazione: (2024)
di: Galichin, Andrey V., et al.
Pubblicazione: (2024)
Documenti analoghi
-
Black-Box Behavioral Distillation Breaks Safety Alignment in Medical LLMs
di: Jahan, Sohely, et al.
Pubblicazione: (2025) -
Curvature-Aware Safety Restoration In LLMs Fine-Tuning
di: Bach, Thong, et al.
Pubblicazione: (2025) -
CASUAL: Conditional Support Alignment for Domain Adaptation with Label Shift
di: Nguyen, Anh T, et al.
Pubblicazione: (2023) -
Kernel Learning for Sample Constrained Black-Box Optimization
di: Rajagopalan, Rajalaxmi, et al.
Pubblicazione: (2025) -
Continual Safety Alignment via Gradient-Based Sample Selection
di: Bach, Thong, et al.
Pubblicazione: (2026)