STAR: Spectral Truncation and Rescale for Model Merging
Fuente:
arXiv
Salvato in:
| Autori principali: | Lee, Yu-Ang, Ko, Ching-Yun, Pedapati, Tejaswini, Chung, I-Hsin, Yeh, Mi-Yen, Chen, Pin-Yu |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Learning Rate Matters: Vanilla LoRA May Suffice for LLM Fine-tuning
di: Lee, Yu-Ang, et al.
Pubblicazione: (2026)
di: Lee, Yu-Ang, et al.
Pubblicazione: (2026)
Differentiable Prompt Learning for Vision Language Models
di: Huang, Zhenhan, et al.
Pubblicazione: (2024)
di: Huang, Zhenhan, et al.
Pubblicazione: (2024)
Large Language Models can be Strong Self-Detoxifiers
di: Ko, Ching-Yun, et al.
Pubblicazione: (2024)
di: Ko, Ching-Yun, et al.
Pubblicazione: (2024)
OjaKV: Context-Aware Online Low-Rank KV Cache Compression
di: Zhu, Yuxuan, et al.
Pubblicazione: (2025)
di: Zhu, Yuxuan, et al.
Pubblicazione: (2025)
ZoomR: Memory Efficient Reasoning through Multi-Granularity Key Value Retrieval
di: Yang, David H., et al.
Pubblicazione: (2026)
di: Yang, David H., et al.
Pubblicazione: (2026)
Large Language Model Confidence Estimation via Black-Box Access
di: Pedapati, Tejaswini, et al.
Pubblicazione: (2024)
di: Pedapati, Tejaswini, et al.
Pubblicazione: (2024)
vLLM Hook v0: A Plug-in for Programming Model Internals on vLLM
di: Ko, Ching-Yun, et al.
Pubblicazione: (2026)
di: Ko, Ching-Yun, et al.
Pubblicazione: (2026)
Merge to Mix: Mixing Datasets via Model Merging
di: Tao, Zhixu Silvia, et al.
Pubblicazione: (2025)
di: Tao, Zhixu Silvia, et al.
Pubblicazione: (2025)
From Static Templates to Dynamic Runtime Graphs: A Survey of Workflow Optimization for LLM Agents
di: Yue, Ling, et al.
Pubblicazione: (2026)
di: Yue, Ling, et al.
Pubblicazione: (2026)
AI Steerability 360: A Toolkit for Steering Large Language Models
di: Miehling, Erik, et al.
Pubblicazione: (2026)
di: Miehling, Erik, et al.
Pubblicazione: (2026)
EpMAN: Episodic Memory AttentioN for Generalizing to Longer Contexts
di: Chaudhury, Subhajit, et al.
Pubblicazione: (2025)
di: Chaudhury, Subhajit, et al.
Pubblicazione: (2025)
Attention Tracker: Detecting Prompt Injection Attacks in LLMs
di: Hung, Kuo-Han, et al.
Pubblicazione: (2024)
di: Hung, Kuo-Han, et al.
Pubblicazione: (2024)
Data-Driven Lipschitz Continuity: A Cost-Effective Approach to Improve Adversarial Robustness
di: Chen, Erh-Chung, et al.
Pubblicazione: (2024)
di: Chen, Erh-Chung, et al.
Pubblicazione: (2024)
Breaking the Reviewer: Assessing the Vulnerability of Large Language Models in Automated Peer Review Under Textual Adversarial Attacks
di: Lin, Tzu-Ling, et al.
Pubblicazione: (2025)
di: Lin, Tzu-Ling, et al.
Pubblicazione: (2025)
Twin-Merging: Dynamic Integration of Modular Expertise in Model Merging
di: Lu, Zhenyi, et al.
Pubblicazione: (2024)
di: Lu, Zhenyi, et al.
Pubblicazione: (2024)
Beyond Facts: Benchmarking Distributional Reading Comprehension in Large Language Models
di: Guo, Pei-Fu, et al.
Pubblicazione: (2026)
di: Guo, Pei-Fu, et al.
Pubblicazione: (2026)
Steal Now and Attack Later: Evaluating Robustness of Object Detection against Black-box Adversarial Attacks
di: Chen, Erh-Chung, et al.
Pubblicazione: (2024)
di: Chen, Erh-Chung, et al.
Pubblicazione: (2024)
Data-driven Clustering and Merging of Adapters for On-device Large Language Models
di: Bohdal, Ondrej, et al.
Pubblicazione: (2026)
di: Bohdal, Ondrej, et al.
Pubblicazione: (2026)
Steering Externalities: Benign Activation Steering Unintentionally Increases Jailbreak Risk for Large Language Models
di: Xiong, Chen, et al.
Pubblicazione: (2026)
di: Xiong, Chen, et al.
Pubblicazione: (2026)
Transport and Merge: Cross-Architecture Merging for Large Language Models
di: Cui, Chenhang, et al.
Pubblicazione: (2026)
di: Cui, Chenhang, et al.
Pubblicazione: (2026)
Patching LLM Like Software: A Lightweight Method for Improving Safety Policy in Large Language Models
di: Arif, Huzaifa, et al.
Pubblicazione: (2025)
di: Arif, Huzaifa, et al.
Pubblicazione: (2025)
SE-Merging: A Self-Enhanced Approach for Dynamic Model Merging
di: Chen, Zijun, et al.
Pubblicazione: (2025)
di: Chen, Zijun, et al.
Pubblicazione: (2025)
On the Benefits of Fine-Grained Loss Truncation: A Case Study on Factuality in Summarization
di: Flores, Lorenzo Jaime Yu, et al.
Pubblicazione: (2024)
di: Flores, Lorenzo Jaime Yu, et al.
Pubblicazione: (2024)
The Thinking Spectrum: An Empirical Study of Tunable Reasoning in LLMs through Model Merging
di: Lan, Xiaochong, et al.
Pubblicazione: (2025)
di: Lan, Xiaochong, et al.
Pubblicazione: (2025)
SuperMerge: An Approach For Gradient-Based Model Merging
di: Yang, Haoyu, et al.
Pubblicazione: (2024)
di: Yang, Haoyu, et al.
Pubblicazione: (2024)
LED-Merging: Mitigating Safety-Utility Conflicts in Model Merging with Location-Election-Disjoint
di: Ma, Qianli, et al.
Pubblicazione: (2025)
di: Ma, Qianli, et al.
Pubblicazione: (2025)
RCP-Merging: Merging Long Chain-of-Thought Models with Domain-Specific Models by Considering Reasoning Capability as Prior
di: Yang, Junyao, et al.
Pubblicazione: (2025)
di: Yang, Junyao, et al.
Pubblicazione: (2025)
Channel Merging: Preserving Specialization for Merged Experts
di: Zhang, Mingyang, et al.
Pubblicazione: (2024)
di: Zhang, Mingyang, et al.
Pubblicazione: (2024)
LiveCLKTBench: Towards Reliable Evaluation of Cross-Lingual Knowledge Transfer in Multilingual LLMs
di: Guo, Pei-Fu, et al.
Pubblicazione: (2025)
di: Guo, Pei-Fu, et al.
Pubblicazione: (2025)
Unraveling the cognitive patterns of Large Language Models through module communities
di: Bhandari, Kushal Raj, et al.
Pubblicazione: (2025)
di: Bhandari, Kushal Raj, et al.
Pubblicazione: (2025)
Merging Triggers, Breaking Backdoors: Defensive Poisoning for Instruction-Tuned Language Models
di: Kim, San, et al.
Pubblicazione: (2026)
di: Kim, San, et al.
Pubblicazione: (2026)
Fundamental Safety-Capability Trade-offs in Fine-tuning Large Language Models
di: Chen, Pin-Yu, et al.
Pubblicazione: (2025)
di: Chen, Pin-Yu, et al.
Pubblicazione: (2025)
From PEFT to DEFT: Parameter Efficient Finetuning for Reducing Activation Density in Transformers
di: Runwal, Bharat, et al.
Pubblicazione: (2024)
di: Runwal, Bharat, et al.
Pubblicazione: (2024)
MergeME: Model Merging Techniques for Homogeneous and Heterogeneous MoEs
di: Zhou, Yuhang, et al.
Pubblicazione: (2025)
di: Zhou, Yuhang, et al.
Pubblicazione: (2025)
BILLY: Steering Large Language Models via Merging Persona Vectors for Creative Generation
di: Pai, Tsung-Min, et al.
Pubblicazione: (2025)
di: Pai, Tsung-Min, et al.
Pubblicazione: (2025)
Tuning LLMs with Contrastive Alignment Instructions for Machine Translation in Unseen, Low-resource Languages
di: Mao, Zhuoyuan, et al.
Pubblicazione: (2024)
di: Mao, Zhuoyuan, et al.
Pubblicazione: (2024)
Diversity Boosts AI-Generated Text Detection
di: Basani, Advik Raj, et al.
Pubblicazione: (2025)
di: Basani, Advik Raj, et al.
Pubblicazione: (2025)
Transferring Textual Preferences to Vision-Language Understanding through Model Merging
di: Li, Chen-An, et al.
Pubblicazione: (2025)
di: Li, Chen-An, et al.
Pubblicazione: (2025)
Injecting Salesperson's Dialogue Strategies in Large Language Models with Chain-of-Thought Reasoning
di: Chang, Wen-Yu, et al.
Pubblicazione: (2024)
di: Chang, Wen-Yu, et al.
Pubblicazione: (2024)
Compound AI Systems Optimization: A Survey of Methods, Challenges, and Future Directions
di: Lee, Yu-Ang, et al.
Pubblicazione: (2025)
di: Lee, Yu-Ang, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Learning Rate Matters: Vanilla LoRA May Suffice for LLM Fine-tuning
di: Lee, Yu-Ang, et al.
Pubblicazione: (2026) -
Differentiable Prompt Learning for Vision Language Models
di: Huang, Zhenhan, et al.
Pubblicazione: (2024) -
Large Language Models can be Strong Self-Detoxifiers
di: Ko, Ching-Yun, et al.
Pubblicazione: (2024) -
OjaKV: Context-Aware Online Low-Rank KV Cache Compression
di: Zhu, Yuxuan, et al.
Pubblicazione: (2025) -
ZoomR: Memory Efficient Reasoning through Multi-Granularity Key Value Retrieval
di: Yang, David H., et al.
Pubblicazione: (2026)