AI-Slop to AI-Polish? Aligning Language Models through Edit-Based Writing Rewards and Test-time Computation
Fuente:
arXiv
Salvato in:
| Autori principali: | Chakrabarty, Tuhin, Laban, Philippe, Wu, Chien-Sheng |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Can AI writing be salvaged? Mitigating Idiosyncrasies and Improving Human-AI Alignment in the Writing Process through Edits
di: Chakrabarty, Tuhin, et al.
Pubblicazione: (2024)
di: Chakrabarty, Tuhin, et al.
Pubblicazione: (2024)
Art or Artifice? Large Language Models and the False Promise of Creativity
di: Chakrabarty, Tuhin, et al.
Pubblicazione: (2023)
di: Chakrabarty, Tuhin, et al.
Pubblicazione: (2023)
Can Good Writing Be Generative? Expert-Level AI Writing Emerges through Fine-Tuning on High-Quality Books
di: Chakrabarty, Tuhin, et al.
Pubblicazione: (2026)
di: Chakrabarty, Tuhin, et al.
Pubblicazione: (2026)
Measuring AI "Slop" in Text
di: Shaib, Chantal, et al.
Pubblicazione: (2025)
di: Shaib, Chantal, et al.
Pubblicazione: (2025)
Almost AI, Almost Human: The Challenge of Detecting AI-Polished Writing
di: Saha, Shoumik, et al.
Pubblicazione: (2025)
di: Saha, Shoumik, et al.
Pubblicazione: (2025)
DeepTRACE: Auditing Deep Research AI Systems for Tracking Reliability Across Citations and Evidence
di: Venkit, Pranav Narayanan, et al.
Pubblicazione: (2025)
di: Venkit, Pranav Narayanan, et al.
Pubblicazione: (2025)
SummExecEdit: A Factual Consistency Benchmark in Summarization with Executable Edits
di: Thorat, Onkar, et al.
Pubblicazione: (2024)
di: Thorat, Onkar, et al.
Pubblicazione: (2024)
Readers Prefer Outputs of AI Trained on Copyrighted Books over Expert Human Writers
di: Chakrabarty, Tuhin, et al.
Pubblicazione: (2025)
di: Chakrabarty, Tuhin, et al.
Pubblicazione: (2025)
Search Engines in an AI Era: The False Promise of Factual and Verifiable Source-Cited Responses
di: Venkit, Pranav Narayanan, et al.
Pubblicazione: (2024)
di: Venkit, Pranav Narayanan, et al.
Pubblicazione: (2024)
AI Safety Should Prioritize the Future of Work
di: Hazra, Sanchaita, et al.
Pubblicazione: (2025)
di: Hazra, Sanchaita, et al.
Pubblicazione: (2025)
ALaRM: Align Language Models via Hierarchical Rewards Modeling
di: Lai, Yuhang, et al.
Pubblicazione: (2024)
di: Lai, Yuhang, et al.
Pubblicazione: (2024)
A Critical Evaluation of AI Feedback for Aligning Large Language Models
di: Sharma, Archit, et al.
Pubblicazione: (2024)
di: Sharma, Archit, et al.
Pubblicazione: (2024)
Reward Collapse in Aligning Large Language Models
di: Song, Ziang, et al.
Pubblicazione: (2023)
di: Song, Ziang, et al.
Pubblicazione: (2023)
AI Slop or AI-enhancement? Student perceptions of AI-generated media for an English for Academic Purposes course
di: Woo, David James, et al.
Pubblicazione: (2026)
di: Woo, David James, et al.
Pubblicazione: (2026)
Self-Rewarding PPO: Aligning Large Language Models with Demonstrations Only
di: Zhang, Qingru, et al.
Pubblicazione: (2025)
di: Zhang, Qingru, et al.
Pubblicazione: (2025)
Why Slop Matters
di: Kommers, Cody, et al.
Pubblicazione: (2025)
di: Kommers, Cody, et al.
Pubblicazione: (2025)
EditReward: A Human-Aligned Reward Model for Instruction-Guided Image Editing
di: Wu, Keming, et al.
Pubblicazione: (2025)
di: Wu, Keming, et al.
Pubblicazione: (2025)
GUNDAM: Aligning Large Language Models with Graph Understanding
di: Ouyang, Sheng, et al.
Pubblicazione: (2024)
di: Ouyang, Sheng, et al.
Pubblicazione: (2024)
From Construction to Injection: Edit-Based Fingerprints for Large Language Models
di: Li, Yue, et al.
Pubblicazione: (2025)
di: Li, Yue, et al.
Pubblicazione: (2025)
Alignment Whack-a-Mole : Finetuning Activates Verbatim Recall of Copyrighted Books in Large Language Models
di: Liu, Xinyue, et al.
Pubblicazione: (2026)
di: Liu, Xinyue, et al.
Pubblicazione: (2026)
Why Vision Language Models Struggle with Visual Arithmetic? Towards Enhanced Chart and Geometry Understanding
di: Huang, Kung-Hsiang, et al.
Pubblicazione: (2025)
di: Huang, Kung-Hsiang, et al.
Pubblicazione: (2025)
Optimizing Diversity and Quality through Base-Aligned Model Collaboration
di: Wang, Yichen, et al.
Pubblicazione: (2025)
di: Wang, Yichen, et al.
Pubblicazione: (2025)
Understanding Figurative Meaning through Explainable Visual Entailment
di: Saakyan, Arkadiy, et al.
Pubblicazione: (2024)
di: Saakyan, Arkadiy, et al.
Pubblicazione: (2024)
Prompt Leakage effect and defense strategies for multi-turn LLM interactions
di: Agarwal, Divyansh, et al.
Pubblicazione: (2024)
di: Agarwal, Divyansh, et al.
Pubblicazione: (2024)
Language-Guided World Models: A Model-Based Approach to AI Control
di: Zhang, Alex, et al.
Pubblicazione: (2024)
di: Zhang, Alex, et al.
Pubblicazione: (2024)
Principled Fine-tuning of LLMs from User-Edits: A Medley of Preference, Supervision, and Reward
di: Misra, Dipendra, et al.
Pubblicazione: (2026)
di: Misra, Dipendra, et al.
Pubblicazione: (2026)
Enhancing AI Assisted Writing with One-Shot Implicit Negative Feedback
di: Towle, Benjamin, et al.
Pubblicazione: (2024)
di: Towle, Benjamin, et al.
Pubblicazione: (2024)
Creativity Support in the Age of Large Language Models: An Empirical Study Involving Emerging Writers
di: Chakrabarty, Tuhin, et al.
Pubblicazione: (2023)
di: Chakrabarty, Tuhin, et al.
Pubblicazione: (2023)
Align to Structure: Aligning Large Language Models with Structural Information
di: Kim, Zae Myung, et al.
Pubblicazione: (2025)
di: Kim, Zae Myung, et al.
Pubblicazione: (2025)
Text2Reward: Reward Shaping with Language Models for Reinforcement Learning
di: Xie, Tianbao, et al.
Pubblicazione: (2023)
di: Xie, Tianbao, et al.
Pubblicazione: (2023)
Resolving UnderEdit & OverEdit with Iterative & Neighbor-Assisted Model Editing
di: Baghel, Bhiman Kumar, et al.
Pubblicazione: (2025)
di: Baghel, Bhiman Kumar, et al.
Pubblicazione: (2025)
Aligning LLM Agents by Learning Latent Preference from User Edits
di: Gao, Ge, et al.
Pubblicazione: (2024)
di: Gao, Ge, et al.
Pubblicazione: (2024)
On the Robustness of Reward Models for Language Model Alignment
di: Hong, Jiwoo, et al.
Pubblicazione: (2025)
di: Hong, Jiwoo, et al.
Pubblicazione: (2025)
UltraEdit: Training-, Subject-, and Memory-Free Lifelong Editing in Language Models
di: Gu, Xiaojie, et al.
Pubblicazione: (2025)
di: Gu, Xiaojie, et al.
Pubblicazione: (2025)
LangTopo: Aligning Language Descriptions of Graphs with Tokenized Topological Modeling
di: Guan, Zhong, et al.
Pubblicazione: (2024)
di: Guan, Zhong, et al.
Pubblicazione: (2024)
Do We Talk to Robots Like Therapists, and Do They Respond Accordingly? Language Alignment in AI Emotional Support
di: Chiang, Sophie, et al.
Pubblicazione: (2025)
di: Chiang, Sophie, et al.
Pubblicazione: (2025)
Provable Scaling Laws for the Test-Time Compute of Large Language Models
di: Chen, Yanxi, et al.
Pubblicazione: (2024)
di: Chen, Yanxi, et al.
Pubblicazione: (2024)
Base Models Look Human To AI Detectors
di: Xu, Yixuan Even, et al.
Pubblicazione: (2026)
di: Xu, Yixuan Even, et al.
Pubblicazione: (2026)
MiniCheck: Efficient Fact-Checking of LLMs on Grounding Documents
di: Tang, Liyan, et al.
Pubblicazione: (2024)
di: Tang, Liyan, et al.
Pubblicazione: (2024)
CHAI for LLMs: Improving Code-Mixed Translation in Large Language Models through Reinforcement Learning with AI Feedback
di: Zhang, Wenbo, et al.
Pubblicazione: (2024)
di: Zhang, Wenbo, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Can AI writing be salvaged? Mitigating Idiosyncrasies and Improving Human-AI Alignment in the Writing Process through Edits
di: Chakrabarty, Tuhin, et al.
Pubblicazione: (2024) -
Art or Artifice? Large Language Models and the False Promise of Creativity
di: Chakrabarty, Tuhin, et al.
Pubblicazione: (2023) -
Can Good Writing Be Generative? Expert-Level AI Writing Emerges through Fine-Tuning on High-Quality Books
di: Chakrabarty, Tuhin, et al.
Pubblicazione: (2026) -
Measuring AI "Slop" in Text
di: Shaib, Chantal, et al.
Pubblicazione: (2025) -
Almost AI, Almost Human: The Challenge of Detecting AI-Polished Writing
di: Saha, Shoumik, et al.
Pubblicazione: (2025)