CopyBench: Measuring Literal and Non-Literal Reproduction of Copyright-Protected Text in Language Model Generation
Fuente:
arXiv
Saved in:
| Main Authors: | Chen, Tong, Asai, Akari, Mireshghallah, Niloofar, Min, Sewon, Grimmelmann, James, Choi, Yejin, Hajishirzi, Hannaneh, Zettlemoyer, Luke, Koh, Pang Wei |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
ParaPO: Aligning Language Models to Reduce Verbatim Reproduction of Pre-training Data
by: Chen, Tong, et al.
Published: (2025)
by: Chen, Tong, et al.
Published: (2025)
Train for Truth, Keep the Skills: Binary Retrieval-Augmented Reward Mitigates Hallucinations
by: Chen, Tong, et al.
Published: (2025)
by: Chen, Tong, et al.
Published: (2025)
Infini-gram: Scaling Unbounded n-gram Language Models to a Trillion Tokens
by: Liu, Jiacheng, et al.
Published: (2024)
by: Liu, Jiacheng, et al.
Published: (2024)
Do Membership Inference Attacks Work on Large Language Models?
by: Duan, Michael, et al.
Published: (2024)
by: Duan, Michael, et al.
Published: (2024)
Reliable, Adaptable, and Attributable Language Models with Retrieval
by: Asai, Akari, et al.
Published: (2024)
by: Asai, Akari, et al.
Published: (2024)
Scaling Retrieval-Based Language Models with a Trillion-Token Datastore
by: Shao, Rulin, et al.
Published: (2024)
by: Shao, Rulin, et al.
Published: (2024)
SILO Language Models: Isolating Legal Risk In a Nonparametric Datastore
by: Min, Sewon, et al.
Published: (2023)
by: Min, Sewon, et al.
Published: (2023)
Beyond Literal Mapping: Benchmarking and Improving Non-Literal Translation Evaluation
by: Tian, Yanzhi, et al.
Published: (2026)
by: Tian, Yanzhi, et al.
Published: (2026)
Literator
Published: (2013)
Published: (2013)
BTR: Binary Token Representations for Efficient Retrieval Augmented Language Models
by: Cao, Qingqing, et al.
Published: (2023)
by: Cao, Qingqing, et al.
Published: (2023)
Literate Tracing
by: Sotoudeh, Matthew
Published: (2025)
by: Sotoudeh, Matthew
Published: (2025)
Literate Execution
by: Bond, Joe, et al.
Published: (2026)
by: Bond, Joe, et al.
Published: (2026)
Provision of Library Service to Non Literates.
by: Ogunsheye, F. Adetowun
Published: (1980)
by: Ogunsheye, F. Adetowun
Published: (1980)
EvalTree: Profiling Language Model Weaknesses via Hierarchical Capability Trees
by: Zeng, Zhiyuan, et al.
Published: (2025)
by: Zeng, Zhiyuan, et al.
Published: (2025)
Fine-grained Hallucination Detection and Editing for Language Models
by: Mishra, Abhika, et al.
Published: (2024)
by: Mishra, Abhika, et al.
Published: (2024)
Metaphor and Literalism in Buddhism
by: Hwang, Soonil
Published: (2025)
by: Hwang, Soonil
Published: (2025)
Becoming Video Literate.
by: Beasley, Augie E.
Published: (1995)
by: Beasley, Augie E.
Published: (1995)
Are You Web Literate?
by: Darrow, Rob
Published: (1999)
by: Darrow, Rob
Published: (1999)
Synthetic Data Can Mislead Evaluations: Membership Inference as Machine Text Detection
by: Naseh, Ali, et al.
Published: (2025)
by: Naseh, Ali, et al.
Published: (2025)
Trust No Bot: Discovering Personal Disclosures in Human-LLM Conversations in the Wild
by: Mireshghallah, Niloofar, et al.
Published: (2024)
by: Mireshghallah, Niloofar, et al.
Published: (2024)
Building Internationally Literate Communities
by: Day, Katie, et al.
Published: (2010)
by: Day, Katie, et al.
Published: (2010)
America's Most Literate Cities.
by: Miller, Jack
Published: (2003)
by: Miller, Jack
Published: (2003)
On the Literal Meaning of Proper Names
by: Nicolás Lo Guercio
Published: (2019)
by: Nicolás Lo Guercio
Published: (2019)
Anchored Decoding: Provably Reducing Copyright Risk for Any Language Model
by: He, Jacqueline, et al.
Published: (2026)
by: He, Jacqueline, et al.
Published: (2026)
Infini-gram mini: Exact n-gram Search at the Internet Scale with FM-Index
by: Xu, Hao, et al.
Published: (2025)
by: Xu, Hao, et al.
Published: (2025)
The Files are in the Computer: On Copyright, Memorization, and Generative AI
by: Cooper, A. Feder, et al.
Published: (2024)
by: Cooper, A. Feder, et al.
Published: (2024)
Reading But Not Literate: The ChildRead Survey.
by: Burgess, Susan A.
Published: (1985)
by: Burgess, Susan A.
Published: (1985)
Literate Beginnings: Programs for Babies and Toddlers.
by: Jeffery, Debby Ann
Published: (1995)
by: Jeffery, Debby Ann
Published: (1995)
Creating a STEM-Literate Society
by: Dow, Mirah J.
Published: (2014)
by: Dow, Mirah J.
Published: (2014)
Toward a Culturally Literate Society.
by: Harris, Karen, et al.
Published: (1989)
by: Harris, Karen, et al.
Published: (1989)
Writing Skill, Literates and Social Apps
by: Mohd Muzamil Sohil
Published: (2017)
by: Mohd Muzamil Sohil
Published: (2017)
Moving On/Keeping Pace: Youth's Literate Identities and Multimodal Digital Texts
by: Alvermann, Donna E.
Published: (2011)
by: Alvermann, Donna E.
Published: (2011)
Alignment Whack-a-Mole : Finetuning Activates Verbatim Recall of Copyrighted Books in Large Language Models
by: Liu, Xinyue, et al.
Published: (2026)
by: Liu, Xinyue, et al.
Published: (2026)
Don't throw away your value model! Generating more preferable text with Value-Guided Monte-Carlo Tree Search decoding
by: Liu, Jiacheng, et al.
Published: (2023)
by: Liu, Jiacheng, et al.
Published: (2023)
Organize the Web: Constructing Domains Enhances Pre-Training Data Curation
by: Wettig, Alexander, et al.
Published: (2025)
by: Wettig, Alexander, et al.
Published: (2025)
Learning to Detect Language Model Training Data via Active Reconstruction
by: Yin, Junjie Oscar, et al.
Published: (2026)
by: Yin, Junjie Oscar, et al.
Published: (2026)
Lost in Literalism: How Supervised Training Shapes Translationese in LLMs
by: Li, Yafu, et al.
Published: (2025)
by: Li, Yafu, et al.
Published: (2025)
A False Sense of Privacy: Evaluating Textual Data Sanitization Beyond Surface-level Privacy Leakage
by: Xin, Rui, et al.
Published: (2025)
by: Xin, Rui, et al.
Published: (2025)
Position: Privacy Is Not Just Memorization!
by: Mireshghallah, Niloofar, et al.
Published: (2025)
by: Mireshghallah, Niloofar, et al.
Published: (2025)
Strongly Refuting Random CSP without Literals
by: Chan, Siu On, et al.
Published: (2026)
by: Chan, Siu On, et al.
Published: (2026)
Similar Items
-
ParaPO: Aligning Language Models to Reduce Verbatim Reproduction of Pre-training Data
by: Chen, Tong, et al.
Published: (2025) -
Train for Truth, Keep the Skills: Binary Retrieval-Augmented Reward Mitigates Hallucinations
by: Chen, Tong, et al.
Published: (2025) -
Infini-gram: Scaling Unbounded n-gram Language Models to a Trillion Tokens
by: Liu, Jiacheng, et al.
Published: (2024) -
Do Membership Inference Attacks Work on Large Language Models?
by: Duan, Michael, et al.
Published: (2024) -
Reliable, Adaptable, and Attributable Language Models with Retrieval
by: Asai, Akari, et al.
Published: (2024)