Alignment Whack-a-Mole : Finetuning Activates Verbatim Recall of Copyrighted Books in Large Language Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Liu, Xinyue, Mireshghallah, Niloofar, Ginsburg, Jane C., Chakrabarty, Tuhin |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Readers Prefer Outputs of AI Trained on Copyrighted Books over Expert Human Writers
di: Chakrabarty, Tuhin, et al.
Pubblicazione: (2025)
di: Chakrabarty, Tuhin, et al.
Pubblicazione: (2025)
Creativity Support in the Age of Large Language Models: An Empirical Study Involving Emerging Writers
di: Chakrabarty, Tuhin, et al.
Pubblicazione: (2023)
di: Chakrabarty, Tuhin, et al.
Pubblicazione: (2023)
ParaPO: Aligning Language Models to Reduce Verbatim Reproduction of Pre-training Data
di: Chen, Tong, et al.
Pubblicazione: (2025)
di: Chen, Tong, et al.
Pubblicazione: (2025)
Developing Story: Case Studies of Generative AI's Use in Journalism
di: Brigham, Natalie Grace, et al.
Pubblicazione: (2024)
di: Brigham, Natalie Grace, et al.
Pubblicazione: (2024)
Can AI writing be salvaged? Mitigating Idiosyncrasies and Improving Human-AI Alignment in the Writing Process through Edits
di: Chakrabarty, Tuhin, et al.
Pubblicazione: (2024)
di: Chakrabarty, Tuhin, et al.
Pubblicazione: (2024)
AI Safety Should Prioritize the Future of Work
di: Hazra, Sanchaita, et al.
Pubblicazione: (2025)
di: Hazra, Sanchaita, et al.
Pubblicazione: (2025)
Can Good Writing Be Generative? Expert-Level AI Writing Emerges through Fine-Tuning on High-Quality Books
di: Chakrabarty, Tuhin, et al.
Pubblicazione: (2026)
di: Chakrabarty, Tuhin, et al.
Pubblicazione: (2026)
Bridging the Copyright Gap: Do Large Vision-Language Models Recognize and Respect Copyrighted Content?
di: Xu, Naen, et al.
Pubblicazione: (2025)
di: Xu, Naen, et al.
Pubblicazione: (2025)
SUV: Scalable Large Language Model Copyright Compliance with Regularized Selective Unlearning
di: Xu, Tianyang, et al.
Pubblicazione: (2025)
di: Xu, Tianyang, et al.
Pubblicazione: (2025)
Reinforcement Learning Improves Traversal of Hierarchical Knowledge in LLMs
di: Zhang, Renfei, et al.
Pubblicazione: (2025)
di: Zhang, Renfei, et al.
Pubblicazione: (2025)
Training-Free Cultural Alignment of Large Language Models via Persona Disagreement
di: Kiet, Huynh Trung, et al.
Pubblicazione: (2026)
di: Kiet, Huynh Trung, et al.
Pubblicazione: (2026)
Self-Alignment of Large Language Models via Monopolylogue-based Social Scene Simulation
di: Pang, Xianghe, et al.
Pubblicazione: (2024)
di: Pang, Xianghe, et al.
Pubblicazione: (2024)
Position: Privacy Is Not Just Memorization!
di: Mireshghallah, Niloofar, et al.
Pubblicazione: (2025)
di: Mireshghallah, Niloofar, et al.
Pubblicazione: (2025)
Political Alignment in Large Language Models: A Multidimensional Audit of Psychometric Identity and Behavioral Bias
di: Sakhawat, Adib, et al.
Pubblicazione: (2026)
di: Sakhawat, Adib, et al.
Pubblicazione: (2026)
Art or Artifice? Large Language Models and the False Promise of Creativity
di: Chakrabarty, Tuhin, et al.
Pubblicazione: (2023)
di: Chakrabarty, Tuhin, et al.
Pubblicazione: (2023)
Foundational Challenges in Assuring Alignment and Safety of Large Language Models
di: Anwar, Usman, et al.
Pubblicazione: (2024)
di: Anwar, Usman, et al.
Pubblicazione: (2024)
Narrative over Numbers: The Identifiable Victim Effect and its Amplification Under Alignment and Reasoning in Large Language Models
di: Raiyan, Syed Rifat
Pubblicazione: (2026)
di: Raiyan, Syed Rifat
Pubblicazione: (2026)
SHIELD: Evaluation and Defense Strategies for Copyright Compliance in LLM Text Generation
di: Liu, Xiaoze, et al.
Pubblicazione: (2024)
di: Liu, Xiaoze, et al.
Pubblicazione: (2024)
Culturally Grounded Personas in Large Language Models: Characterization and Alignment with Socio-Psychological Value Frameworks
di: Greco, Candida M., et al.
Pubblicazione: (2026)
di: Greco, Candida M., et al.
Pubblicazione: (2026)
Whack-a-Chip: The Futility of Hardware-Centric Export Controls
di: Gupta, Ritwik, et al.
Pubblicazione: (2024)
di: Gupta, Ritwik, et al.
Pubblicazione: (2024)
LocalValueBench: A Collaboratively Built and Extensible Benchmark for Evaluating Localized Value Alignment and Ethical Safety in Large Language Models
di: Meadows, Gwenyth Isobel, et al.
Pubblicazione: (2024)
di: Meadows, Gwenyth Isobel, et al.
Pubblicazione: (2024)
How to Stop Playing Whack-a-Mole: Mapping the Ecosystem of Technologies Facilitating AI-Generated Non-Consensual Intimate Images
di: Ding, Michelle L., et al.
Pubblicazione: (2026)
di: Ding, Michelle L., et al.
Pubblicazione: (2026)
On the Creativity of Large Language Models
di: Franceschelli, Giorgio, et al.
Pubblicazione: (2023)
di: Franceschelli, Giorgio, et al.
Pubblicazione: (2023)
Contextual StereoSet: Stress-Testing Bias Alignment Robustness in Large Language Models
di: Basu, Abhinaba, et al.
Pubblicazione: (2026)
di: Basu, Abhinaba, et al.
Pubblicazione: (2026)
PersLLM: A Personified Training Approach for Large Language Models
di: Zeng, Zheni, et al.
Pubblicazione: (2024)
di: Zeng, Zheni, et al.
Pubblicazione: (2024)
In Silico Sociology: Forecasting COVID-19 Polarization with Large Language Models
di: Kozlowski, Austin C., et al.
Pubblicazione: (2024)
di: Kozlowski, Austin C., et al.
Pubblicazione: (2024)
AI-Slop to AI-Polish? Aligning Language Models through Edit-Based Writing Rewards and Test-time Computation
di: Chakrabarty, Tuhin, et al.
Pubblicazione: (2025)
di: Chakrabarty, Tuhin, et al.
Pubblicazione: (2025)
Cross-Language Bias Examination in Large Language Models
di: Liang, Yuxuan, et al.
Pubblicazione: (2025)
di: Liang, Yuxuan, et al.
Pubblicazione: (2025)
Differentially Private Learning Needs Better Model Initialization and Self-Distillation
di: Ngong, Ivoline C., et al.
Pubblicazione: (2024)
di: Ngong, Ivoline C., et al.
Pubblicazione: (2024)
Investigating Cultural Alignment of Large Language Models
di: AlKhamissi, Badr, et al.
Pubblicazione: (2024)
di: AlKhamissi, Badr, et al.
Pubblicazione: (2024)
Large Language Models Develop Novel Social Biases Through Adaptive Exploration
di: Wu, Addison J., et al.
Pubblicazione: (2025)
di: Wu, Addison J., et al.
Pubblicazione: (2025)
LLM Agents in Interaction: Measuring Personality Consistency and Linguistic Alignment in Interacting Populations of Large Language Models
di: Frisch, Ivar, et al.
Pubblicazione: (2024)
di: Frisch, Ivar, et al.
Pubblicazione: (2024)
Large Legal Fictions: Profiling Legal Hallucinations in Large Language Models
di: Dahl, Matthew, et al.
Pubblicazione: (2024)
di: Dahl, Matthew, et al.
Pubblicazione: (2024)
Evaluating Large Language Models for Detecting Antisemitism
di: Patel, Jay, et al.
Pubblicazione: (2025)
di: Patel, Jay, et al.
Pubblicazione: (2025)
Anticipating Innovation Using Large Language Models
di: Fenoaltea, Enrico Maria, et al.
Pubblicazione: (2026)
di: Fenoaltea, Enrico Maria, et al.
Pubblicazione: (2026)
Open-Ended Wargames with Large Language Models
di: Hogan, Daniel P., et al.
Pubblicazione: (2024)
di: Hogan, Daniel P., et al.
Pubblicazione: (2024)
Large Language Models for Education: A Survey
di: Xu, Hanyi, et al.
Pubblicazione: (2024)
di: Xu, Hanyi, et al.
Pubblicazione: (2024)
How Large Language Models are Designed to Hallucinate
di: Ackermann, Richard, et al.
Pubblicazione: (2025)
di: Ackermann, Richard, et al.
Pubblicazione: (2025)
Large Language Models as Misleading Assistants in Conversation
di: Hou, Betty Li, et al.
Pubblicazione: (2024)
di: Hou, Betty Li, et al.
Pubblicazione: (2024)
Evaluating Psychological Safety of Large Language Models
di: Li, Xingxuan, et al.
Pubblicazione: (2022)
di: Li, Xingxuan, et al.
Pubblicazione: (2022)
Documenti analoghi
-
Readers Prefer Outputs of AI Trained on Copyrighted Books over Expert Human Writers
di: Chakrabarty, Tuhin, et al.
Pubblicazione: (2025) -
Creativity Support in the Age of Large Language Models: An Empirical Study Involving Emerging Writers
di: Chakrabarty, Tuhin, et al.
Pubblicazione: (2023) -
ParaPO: Aligning Language Models to Reduce Verbatim Reproduction of Pre-training Data
di: Chen, Tong, et al.
Pubblicazione: (2025) -
Developing Story: Case Studies of Generative AI's Use in Journalism
di: Brigham, Natalie Grace, et al.
Pubblicazione: (2024) -
Can AI writing be salvaged? Mitigating Idiosyncrasies and Improving Human-AI Alignment in the Writing Process through Edits
di: Chakrabarty, Tuhin, et al.
Pubblicazione: (2024)