Model Surgery: Modulating LLM's Behavior Via Simple Parameter Editing
Fuente:
arXiv
Salvato in:
| Autori principali: | Wang, Huanqian, Yue, Yang, Lu, Rui, Shi, Jingxin, Zhao, Andrew, Wang, Shenzhi, Song, Shiji, Huang, Gao |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
TableMoE: Neuro-Symbolic Routing for Structured Expert Reasoning in Multimodal Table Understanding
di: Zhang, Junwen, et al.
Pubblicazione: (2025)
di: Zhang, Junwen, et al.
Pubblicazione: (2025)
Does CLIP perceive art the same way we do?
di: Asperti, Andrea, et al.
Pubblicazione: (2025)
di: Asperti, Andrea, et al.
Pubblicazione: (2025)
ProactBench: Beyond What The User Asked For
di: Harfi, Sepehr, et al.
Pubblicazione: (2026)
di: Harfi, Sepehr, et al.
Pubblicazione: (2026)
AVATAAR: Agentic Video Answering via Temporal Adaptive Alignment and Reasoning
di: Patel, Urjitkumar, et al.
Pubblicazione: (2025)
di: Patel, Urjitkumar, et al.
Pubblicazione: (2025)
Logistic Regression makes small LLMs strong and explainable "tens-of-shot" classifiers
di: Buckmann, Marcus, et al.
Pubblicazione: (2024)
di: Buckmann, Marcus, et al.
Pubblicazione: (2024)
A Survey on Collaborating Small and Large Language Models for Performance, Cost-effectiveness, Cloud-edge Privacy, and Trustworthiness
di: Wang, Fali, et al.
Pubblicazione: (2025)
di: Wang, Fali, et al.
Pubblicazione: (2025)
Understanding Reinforcement Learning for Model Training, and future directions with GRAPE
di: Patel, Rohit
Pubblicazione: (2025)
di: Patel, Rohit
Pubblicazione: (2025)
Unraveling Media Perspectives: A Comprehensive Methodology Combining Large Language Models, Topic Modeling, Sentiment Analysis, and Ontology Learning to Analyse Media Bias
di: Jähde, Orlando, et al.
Pubblicazione: (2025)
di: Jähde, Orlando, et al.
Pubblicazione: (2025)
MORQA: Benchmarking Evaluation Metrics for Medical Open-Ended Question Answering
di: Yim, Wen-wai, et al.
Pubblicazione: (2025)
di: Yim, Wen-wai, et al.
Pubblicazione: (2025)
TowerVision: Understanding and Improving Multilinguality in Vision-Language Models
di: Viveiros, André G., et al.
Pubblicazione: (2025)
di: Viveiros, André G., et al.
Pubblicazione: (2025)
Unpacking Hateful Memes: Presupposed Context and False Claims
di: Cai, Weibin, et al.
Pubblicazione: (2025)
di: Cai, Weibin, et al.
Pubblicazione: (2025)
Application of deep learning approaches for medieval historical documents transcription
di: Voloshchuk, Maksym, et al.
Pubblicazione: (2025)
di: Voloshchuk, Maksym, et al.
Pubblicazione: (2025)
A Comprehensive Survey of Small Language Models in the Era of Large Language Models: Techniques, Enhancements, Applications, Collaboration with LLMs, and Trustworthiness
di: Wang, Fali, et al.
Pubblicazione: (2024)
di: Wang, Fali, et al.
Pubblicazione: (2024)
A Survey on Vision-Language-Action Models for Embodied AI
di: Ma, Yueen, et al.
Pubblicazione: (2024)
di: Ma, Yueen, et al.
Pubblicazione: (2024)
Do Reasoning Models Enhance Embedding Models?
di: Chan, Wun Yu, et al.
Pubblicazione: (2026)
di: Chan, Wun Yu, et al.
Pubblicazione: (2026)
MetaCheckGPT -- A Multi-task Hallucination Detector Using LLM Uncertainty and Meta-models
di: Mehta, Rahul, et al.
Pubblicazione: (2024)
di: Mehta, Rahul, et al.
Pubblicazione: (2024)
Research on a hybrid LSTM-CNN-Attention model for text-based web content classification
di: Kuz, Mykola, et al.
Pubblicazione: (2025)
di: Kuz, Mykola, et al.
Pubblicazione: (2025)
Linguistic Collapse: Neural Collapse in (Large) Language Models
di: Wu, Robert, et al.
Pubblicazione: (2024)
di: Wu, Robert, et al.
Pubblicazione: (2024)
CLMN: Concept based Language Models via Neural Symbolic Reasoning
di: Yang, Yibo
Pubblicazione: (2025)
di: Yang, Yibo
Pubblicazione: (2025)
AgentDS Technical Report: Benchmarking the Future of Human-AI Collaboration in Domain-Specific Data Science
di: Luo, An, et al.
Pubblicazione: (2026)
di: Luo, An, et al.
Pubblicazione: (2026)
MedMemoryBench: Benchmarking Agent Memory in Personalized Healthcare
di: Wang, Yihao, et al.
Pubblicazione: (2026)
di: Wang, Yihao, et al.
Pubblicazione: (2026)
Atyaephyra at SemEval-2025 Task 4: Low-Rank Negative Preference Optimization
di: Bronec, Jan, et al.
Pubblicazione: (2025)
di: Bronec, Jan, et al.
Pubblicazione: (2025)
Harnessing non-adversarial robustness in large language models
di: Zhou, Qinghua, et al.
Pubblicazione: (2026)
di: Zhou, Qinghua, et al.
Pubblicazione: (2026)
CogniLoad: A Synthetic Natural Language Reasoning Benchmark With Tunable Length, Intrinsic Difficulty, and Distractor Density
di: Kaiser, Daniel, et al.
Pubblicazione: (2025)
di: Kaiser, Daniel, et al.
Pubblicazione: (2025)
Cache-to-Cache: Direct Semantic Communication Between Large Language Models
di: Fu, Tianyu, et al.
Pubblicazione: (2025)
di: Fu, Tianyu, et al.
Pubblicazione: (2025)
When Does Content-Based Routing Work? Representation Requirements for Selective Attention in Hybrid Sequence Models
di: Basu, Abhinaba
Pubblicazione: (2026)
di: Basu, Abhinaba
Pubblicazione: (2026)
NOTAI.AI: Explainable Detection of Machine-Generated Text via Curvature and Feature Attribution
di: Breneur, Oleksandr Marchenko, et al.
Pubblicazione: (2026)
di: Breneur, Oleksandr Marchenko, et al.
Pubblicazione: (2026)
Rethinking the Multilingual Reasoning Gap with Layer Swap
di: Lasbordes, Maxence, et al.
Pubblicazione: (2026)
di: Lasbordes, Maxence, et al.
Pubblicazione: (2026)
Can Agentic AI Match the Performance of Human Data Scientists?
di: Luo, An, et al.
Pubblicazione: (2025)
di: Luo, An, et al.
Pubblicazione: (2025)
A Hybrid Vision-Language Architecture for Automated Defect Reasoning and Report Generation in Industrial Inspection
di: Malikussaid, et al.
Pubblicazione: (2026)
di: Malikussaid, et al.
Pubblicazione: (2026)
RACAS: Controlling Diverse Robots With a Single Agentic System
di: Ashley, Dylan R., et al.
Pubblicazione: (2026)
di: Ashley, Dylan R., et al.
Pubblicazione: (2026)
Uncovering Uncertainty in Transformer Inference
di: Brothers, Greyson, et al.
Pubblicazione: (2024)
di: Brothers, Greyson, et al.
Pubblicazione: (2024)
Benchmarking Vision Language Models on German Factual Data
di: Peinl, René, et al.
Pubblicazione: (2025)
di: Peinl, René, et al.
Pubblicazione: (2025)
ExpliCa: Evaluating Explicit Causal Reasoning in Large Language Models
di: Miliani, Martina, et al.
Pubblicazione: (2025)
di: Miliani, Martina, et al.
Pubblicazione: (2025)
Context Aware Lemmatization and Morphological Tagging Method in Turkish
di: Sayallar, Cagri
Pubblicazione: (2025)
di: Sayallar, Cagri
Pubblicazione: (2025)
Prompting Encoder Models for Zero-Shot Classification: A Cross-Domain Study in Italian
di: Auriemma, Serena, et al.
Pubblicazione: (2024)
di: Auriemma, Serena, et al.
Pubblicazione: (2024)
The GPT-4o Shock Emotional Attachment to AI Models and Its Impact on Regulatory Acceptance: A Cross-Cultural Analysis of the Immediate Transition from GPT-4o to GPT-5
di: Naito, Hiroki
Pubblicazione: (2025)
di: Naito, Hiroki
Pubblicazione: (2025)
Generative AI Models: Opportunities and Risks for Industry and Authorities
di: Alt, Tobias, et al.
Pubblicazione: (2024)
di: Alt, Tobias, et al.
Pubblicazione: (2024)
CLEV: LLM-Based Evaluation Through Lightweight Efficient Voting for Free-Form Question-Answering
di: Badshah, Sher, et al.
Pubblicazione: (2025)
di: Badshah, Sher, et al.
Pubblicazione: (2025)
AssistedDS: Benchmarking How External Domain Knowledge Assists LLMs in Automated Data Science
di: Luo, An, et al.
Pubblicazione: (2025)
di: Luo, An, et al.
Pubblicazione: (2025)
Documenti analoghi
-
TableMoE: Neuro-Symbolic Routing for Structured Expert Reasoning in Multimodal Table Understanding
di: Zhang, Junwen, et al.
Pubblicazione: (2025) -
Does CLIP perceive art the same way we do?
di: Asperti, Andrea, et al.
Pubblicazione: (2025) -
ProactBench: Beyond What The User Asked For
di: Harfi, Sepehr, et al.
Pubblicazione: (2026) -
AVATAAR: Agentic Video Answering via Temporal Adaptive Alignment and Reasoning
di: Patel, Urjitkumar, et al.
Pubblicazione: (2025) -
Logistic Regression makes small LLMs strong and explainable "tens-of-shot" classifiers
di: Buckmann, Marcus, et al.
Pubblicazione: (2024)