Understanding the Effects of RLHF on the Quality and Detectability of LLM-Generated Texts
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Xu, Beining, Zubiaga, Arkaitz |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Technical Report on the Pangram AI-Generated Text Classifier
par: Emi, Bradley, et autres
Publié: (2024)
par: Emi, Bradley, et autres
Publié: (2024)
CATER: Leveraging LLM to Pioneer a Multidimensional, Reference-Independent Paradigm in Translation Quality Evaluation
par: IIDA, Kurando, et autres
Publié: (2024)
par: IIDA, Kurando, et autres
Publié: (2024)
Dynamic Demonstration Retrieval and Cognitive Understanding for Emotional Support Conversation
par: Xu, Zhe, et autres
Publié: (2024)
par: Xu, Zhe, et autres
Publié: (2024)
Pun Unintended: LLMs and the Illusion of Humor Understanding
par: Zangari, Alessandro, et autres
Publié: (2025)
par: Zangari, Alessandro, et autres
Publié: (2025)
HR-MultiWOZ: A Task Oriented Dialogue (TOD) Dataset for HR LLM Agent
par: Xu, Weijie, et autres
Publié: (2024)
par: Xu, Weijie, et autres
Publié: (2024)
LLMs Know More Than They Show: On the Intrinsic Representation of LLM Hallucinations
par: Orgad, Hadas, et autres
Publié: (2024)
par: Orgad, Hadas, et autres
Publié: (2024)
Raw Text is All you Need: Knowledge-intensive Multi-turn Instruction Tuning for Large Language Model
par: Hou, Xia, et autres
Publié: (2024)
par: Hou, Xia, et autres
Publié: (2024)
Obfuscation Rules for Detecting and Detoxifying Korean Toxicity
par: Lee, Yejin, et autres
Publié: (2025)
par: Lee, Yejin, et autres
Publié: (2025)
Isolating LLM Lexical Bias: A Curation-Free Triangulated Metric for Preference-Stage Learning
par: Ming, Xiaoyang, et autres
Publié: (2026)
par: Ming, Xiaoyang, et autres
Publié: (2026)
Contrasting Linguistic Patterns in Human and LLM-Generated News Text
par: Muñoz-Ortiz, Alberto, et autres
Publié: (2023)
par: Muñoz-Ortiz, Alberto, et autres
Publié: (2023)
A Study on Bias Detection and Classification in Natural Language Processing
par: Evans, Ana Sofia, et autres
Publié: (2024)
par: Evans, Ana Sofia, et autres
Publié: (2024)
Triad: A Framework Leveraging a Multi-Role LLM-based Agent to Solve Knowledge Base Question Answering
par: Zong, Chang, et autres
Publié: (2024)
par: Zong, Chang, et autres
Publié: (2024)
RV-HATE: Reinforced Multi-Module Voting for Implicit Hate Speech Detection
par: Lee, Yejin, et autres
Publié: (2025)
par: Lee, Yejin, et autres
Publié: (2025)
Topeax -- An Improved Clustering Topic Model with Density Peak Detection and Lexical-Semantic Term Importance
par: Kardos, Márton
Publié: (2026)
par: Kardos, Márton
Publié: (2026)
Textual Data Bias Detection and Mitigation -- An Extensible Pipeline with Experimental Evaluation
par: Görge, Rebekka, et autres
Publié: (2025)
par: Görge, Rebekka, et autres
Publié: (2025)
EmPO: Emotion Grounding for Empathetic Response Generation through Preference Optimization
par: Sotolar, Ondrej, et autres
Publié: (2024)
par: Sotolar, Ondrej, et autres
Publié: (2024)
Efficient Adaptive Rejection Sampling for Accelerating Speculative Decoding in Large Language Models
par: Sun, Chendong, et autres
Publié: (2025)
par: Sun, Chendong, et autres
Publié: (2025)
S2vNTM: Semi-supervised vMF Neural Topic Modeling
par: Xu, Weijie, et autres
Publié: (2023)
par: Xu, Weijie, et autres
Publié: (2023)
The Personalization Trap: How User Memory Alters Emotional Reasoning in LLMs
par: Fang, Xi, et autres
Publié: (2025)
par: Fang, Xi, et autres
Publié: (2025)
MetaCheckGPT -- A Multi-task Hallucination Detector Using LLM Uncertainty and Meta-models
par: Mehta, Rahul, et autres
Publié: (2024)
par: Mehta, Rahul, et autres
Publié: (2024)
Enhancing Text Classification through LLM-Driven Active Learning and Human Annotation
par: Rouzegar, Hamidreza, et autres
Publié: (2024)
par: Rouzegar, Hamidreza, et autres
Publié: (2024)
Do LLMs Truly Understand When a Precedent Is Overruled?
par: Zhang, Li, et autres
Publié: (2025)
par: Zhang, Li, et autres
Publié: (2025)
Investigating on RLHF methodology
par: Kutalev, Alexey, et autres
Publié: (2024)
par: Kutalev, Alexey, et autres
Publié: (2024)
Performance Evaluation of Sentiment Analysis on Text and Emoji Data Using End-to-End, Transfer Learning, Distributed and Explainable AI Models
par: Velampalli, Sirisha, et autres
Publié: (2025)
par: Velampalli, Sirisha, et autres
Publié: (2025)
No Memorization, No Detection: Output Distribution-Based Contamination Detection in Small Language Models
par: Sela, Omer
Publié: (2026)
par: Sela, Omer
Publié: (2026)
Mitigating LLM Hallucinations through Domain-Grounded Tiered Retrieval
par: Haque, Md. Asraful, et autres
Publié: (2026)
par: Haque, Md. Asraful, et autres
Publié: (2026)
Cognitive Workspace: Active Memory Management for LLMs -- An Empirical Study of Functional Infinite Context
par: An, Tao
Publié: (2025)
par: An, Tao
Publié: (2025)
One Agent to Serve All: a Lite-Adaptive Stylized AI Assistant for Millions of Multi-Style Official Accounts
par: Fan, Xingyu, et autres
Publié: (2025)
par: Fan, Xingyu, et autres
Publié: (2025)
A Graph-based Approach for Multi-Modal Question Answering from Flowcharts in Telecom Documents
par: Soman, Sumit, et autres
Publié: (2025)
par: Soman, Sumit, et autres
Publié: (2025)
SpokenNativQA: Multilingual Everyday Spoken Queries for LLMs
par: Alam, Firoj, et autres
Publié: (2025)
par: Alam, Firoj, et autres
Publié: (2025)
Boundless Byte Pair Encoding: Breaking the Pre-tokenization Barrier
par: Schmidt, Craig W., et autres
Publié: (2025)
par: Schmidt, Craig W., et autres
Publié: (2025)
Learning When to Think: Shaping Adaptive Reasoning in R1-Style Models via Multi-Stage RL
par: Tu, Songjun, et autres
Publié: (2025)
par: Tu, Songjun, et autres
Publié: (2025)
Reducing Hallucinations in Summarization via Reinforcement Learning with Entity Hallucination Index
par: Katwe, Praveenkumar, et autres
Publié: (2025)
par: Katwe, Praveenkumar, et autres
Publié: (2025)
Bielik 11B v2 Technical Report
par: Ociepa, Krzysztof, et autres
Publié: (2025)
par: Ociepa, Krzysztof, et autres
Publié: (2025)
MORABLES: A Benchmark for Assessing Abstract Moral Reasoning in LLMs with Fables
par: Marcuzzo, Matteo, et autres
Publié: (2025)
par: Marcuzzo, Matteo, et autres
Publié: (2025)
Multi-chain Graph Refinement and Selection for Reliable Reasoning in Large Language Models
par: Yang, Yujiao, et autres
Publié: (2025)
par: Yang, Yujiao, et autres
Publié: (2025)
The Impact of Role Design in In-Context Learning for Large Language Models
par: Rouzegar, Hamidreza, et autres
Publié: (2025)
par: Rouzegar, Hamidreza, et autres
Publié: (2025)
Semantic Synergy: Unlocking Policy Insights and Learning Pathways Through Advanced Skill Mapping
par: Koundouri, Phoebe, et autres
Publié: (2025)
par: Koundouri, Phoebe, et autres
Publié: (2025)
DYNAMICQA: Tracing Internal Knowledge Conflicts in Language Models
par: Marjanović, Sara Vera, et autres
Publié: (2024)
par: Marjanović, Sara Vera, et autres
Publié: (2024)
TREX: Tokenizer Regression for Optimal Data Mixture
par: Won, Inho, et autres
Publié: (2026)
par: Won, Inho, et autres
Publié: (2026)
Documents similaires
-
Technical Report on the Pangram AI-Generated Text Classifier
par: Emi, Bradley, et autres
Publié: (2024) -
CATER: Leveraging LLM to Pioneer a Multidimensional, Reference-Independent Paradigm in Translation Quality Evaluation
par: IIDA, Kurando, et autres
Publié: (2024) -
Dynamic Demonstration Retrieval and Cognitive Understanding for Emotional Support Conversation
par: Xu, Zhe, et autres
Publié: (2024) -
Pun Unintended: LLMs and the Illusion of Humor Understanding
par: Zangari, Alessandro, et autres
Publié: (2025) -
HR-MultiWOZ: A Task Oriented Dialogue (TOD) Dataset for HR LLM Agent
par: Xu, Weijie, et autres
Publié: (2024)