Evaluating the Paperclip Maximizer: Are RL-Based Language Models More Likely to Pursue Instrumental Goals?
Fuente:
arXiv
Salvato in:
| Autori principali: | He, Yufei, Li, Yuexin, Wu, Jiaying, Sui, Yuan, Chen, Yulin, Hooi, Bryan |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Can Knowledge Graphs Make Large Language Models More Trustworthy? An Empirical Study Over Open-ended Question Answering
di: Sui, Yuan, et al.
Pubblicazione: (2024)
di: Sui, Yuan, et al.
Pubblicazione: (2024)
Conversation for Non-verifiable Learning: Self-Evolving LLMs through Meta-Evaluation
di: Sui, Yuan, et al.
Pubblicazione: (2026)
di: Sui, Yuan, et al.
Pubblicazione: (2026)
FiDeLiS: Faithful Reasoning in Large Language Model for Knowledge Graph Question Answering
di: Sui, Yuan, et al.
Pubblicazione: (2024)
di: Sui, Yuan, et al.
Pubblicazione: (2024)
ConfTuner: Training Large Language Models to Express Their Confidence Verbally
di: Li, Yibo, et al.
Pubblicazione: (2025)
di: Li, Yibo, et al.
Pubblicazione: (2025)
AliMark: Enhancing Robustness of Sentence-Level Watermarking Against Text Paraphrasing
di: Li, Yuexin, et al.
Pubblicazione: (2026)
di: Li, Yuexin, et al.
Pubblicazione: (2026)
Meta-Reasoner: Dynamic Guidance for Optimized Inference-time Reasoning in Large Language Models
di: Sui, Yuan, et al.
Pubblicazione: (2025)
di: Sui, Yuan, et al.
Pubblicazione: (2025)
JudgeLRM: Large Reasoning Models as a Judge
di: Chen, Nuo, et al.
Pubblicazione: (2025)
di: Chen, Nuo, et al.
Pubblicazione: (2025)
MLR-Bench: Evaluating AI Agents on Open-Ended Machine Learning Research
di: Chen, Hui, et al.
Pubblicazione: (2025)
di: Chen, Hui, et al.
Pubblicazione: (2025)
Fake News in Sheep's Clothing: Robust Fake News Detection Against LLM-Empowered Style Attacks
di: Wu, Jiaying, et al.
Pubblicazione: (2023)
di: Wu, Jiaying, et al.
Pubblicazione: (2023)
KnowPhish: Large Language Models Meet Multimodal Knowledge Graphs for Enhancing Reference-Based Phishing Detection
di: Li, Yuexin, et al.
Pubblicazione: (2024)
di: Li, Yuexin, et al.
Pubblicazione: (2024)
Seeing is Believing: Mitigating Hallucination in Large Vision-Language Models via CLIP-Guided Decoding
di: Deng, Ailin, et al.
Pubblicazione: (2024)
di: Deng, Ailin, et al.
Pubblicazione: (2024)
TACT: Mitigating Overthinking and Overacting in Coding Agents via Activation Steering
di: Sui, Yuan, et al.
Pubblicazione: (2026)
di: Sui, Yuan, et al.
Pubblicazione: (2026)
Beyond Brainstorming: What Drives High-Quality Scientific Ideas? Lessons from Multi-Agent Collaboration
di: Chen, Nuo, et al.
Pubblicazione: (2025)
di: Chen, Nuo, et al.
Pubblicazione: (2025)
Rewarding the Rare: Uniqueness-Aware RL for Creative Problem Solving in LLMs
di: Hu, Zhiyuan, et al.
Pubblicazione: (2026)
di: Hu, Zhiyuan, et al.
Pubblicazione: (2026)
Words or Vision: Do Vision-Language Models Have Blind Faith in Text?
di: Deng, Ailin, et al.
Pubblicazione: (2025)
di: Deng, Ailin, et al.
Pubblicazione: (2025)
UniGraph: Learning a Unified Cross-Domain Foundation Model for Text-Attributed Graphs
di: He, Yufei, et al.
Pubblicazione: (2024)
di: He, Yufei, et al.
Pubblicazione: (2024)
EvoTest: Evolutionary Test-Time Learning for Self-Improving Agentic Systems
di: He, Yufei, et al.
Pubblicazione: (2025)
di: He, Yufei, et al.
Pubblicazione: (2025)
Seeing Through Deception: Uncovering Misleading Creator Intent in Multimodal News with Vision-Language Models
di: Wu, Jiaying, et al.
Pubblicazione: (2025)
di: Wu, Jiaying, et al.
Pubblicazione: (2025)
Test-Time Scaling in Reasoning Models Is Not Effective for Knowledge-Intensive Tasks Yet
di: Zhao, James Xu, et al.
Pubblicazione: (2025)
di: Zhao, James Xu, et al.
Pubblicazione: (2025)
Asynchronous RLHF: Faster and More Efficient Off-Policy RL for Language Models
di: Noukhovitch, Michael, et al.
Pubblicazione: (2024)
di: Noukhovitch, Michael, et al.
Pubblicazione: (2024)
Evaluating the Goal-Directedness of Large Language Models
di: Everitt, Tom, et al.
Pubblicazione: (2025)
di: Everitt, Tom, et al.
Pubblicazione: (2025)
Primacy Effect of ChatGPT
di: Wang, Yiwei, et al.
Pubblicazione: (2023)
di: Wang, Yiwei, et al.
Pubblicazione: (2023)
Critique-RL: Training Language Models for Critiquing through Two-Stage Reinforcement Learning
di: Xi, Zhiheng, et al.
Pubblicazione: (2025)
di: Xi, Zhiheng, et al.
Pubblicazione: (2025)
DetectRL: Benchmarking LLM-Generated Text Detection in Real-World Scenarios
di: Wu, Junchao, et al.
Pubblicazione: (2024)
di: Wu, Junchao, et al.
Pubblicazione: (2024)
Automating Steering for Safe Multimodal Large Language Models
di: Wu, Lyucheng, et al.
Pubblicazione: (2025)
di: Wu, Lyucheng, et al.
Pubblicazione: (2025)
SelfGoal: Your Language Agents Already Know How to Achieve High-level Goals
di: Yang, Ruihan, et al.
Pubblicazione: (2024)
di: Yang, Ruihan, et al.
Pubblicazione: (2024)
Quantifying Semantic Emergence in Language Models
di: Chen, Hang, et al.
Pubblicazione: (2024)
di: Chen, Hang, et al.
Pubblicazione: (2024)
Distributional Clarity: The Hidden Driver of RL-Friendliness in Large Language Models
di: Sun, Shaoning, et al.
Pubblicazione: (2026)
di: Sun, Shaoning, et al.
Pubblicazione: (2026)
Enabling Self-Improving Agents to Learn at Test Time With Human-In-The-Loop Guidance
di: He, Yufei, et al.
Pubblicazione: (2025)
di: He, Yufei, et al.
Pubblicazione: (2025)
LIMR: Less is More for RL Scaling
di: Li, Xuefeng, et al.
Pubblicazione: (2025)
di: Li, Xuefeng, et al.
Pubblicazione: (2025)
Mind the Goal: Data-Efficient Goal-Oriented Evaluation of Conversational Agents and Chatbots using Teacher Models
di: Piskala, Deepak Babu, et al.
Pubblicazione: (2025)
di: Piskala, Deepak Babu, et al.
Pubblicazione: (2025)
Hallucinate Less by Thinking More: Aspect-Based Causal Abstention for Large Language Models
di: Nguyen, Vy, et al.
Pubblicazione: (2025)
di: Nguyen, Vy, et al.
Pubblicazione: (2025)
Steering Evaluation-Aware Language Models to Act Like They Are Deployed
di: Hua, Tim Tian, et al.
Pubblicazione: (2025)
di: Hua, Tim Tian, et al.
Pubblicazione: (2025)
Autonomous Chain-of-Thought Distillation for Graph-Based Fraud Detection
di: Li, Yuan, et al.
Pubblicazione: (2026)
di: Li, Yuan, et al.
Pubblicazione: (2026)
Evaluation of data inconsistency for multi-modal sentiment analysis
di: Wang, Yufei, et al.
Pubblicazione: (2024)
di: Wang, Yufei, et al.
Pubblicazione: (2024)
From Long to Short: LLMs Excel at Trimming Own Reasoning Chains
di: Han, Wei, et al.
Pubblicazione: (2025)
di: Han, Wei, et al.
Pubblicazione: (2025)
Logic-RL: Unleashing LLM Reasoning with Rule-Based Reinforcement Learning
di: Xie, Tian, et al.
Pubblicazione: (2025)
di: Xie, Tian, et al.
Pubblicazione: (2025)
Planning without Search: Refining Frontier LLMs with Offline Goal-Conditioned RL
di: Hong, Joey, et al.
Pubblicazione: (2025)
di: Hong, Joey, et al.
Pubblicazione: (2025)
Uncertainty of Thoughts: Uncertainty-Aware Planning Enhances Information Seeking in Large Language Models
di: Hu, Zhiyuan, et al.
Pubblicazione: (2024)
di: Hu, Zhiyuan, et al.
Pubblicazione: (2024)
WARD: Adversarially Robust Defense of Web Agents Against Prompt Injections
di: Cao, Tri, et al.
Pubblicazione: (2026)
di: Cao, Tri, et al.
Pubblicazione: (2026)
Documenti analoghi
-
Can Knowledge Graphs Make Large Language Models More Trustworthy? An Empirical Study Over Open-ended Question Answering
di: Sui, Yuan, et al.
Pubblicazione: (2024) -
Conversation for Non-verifiable Learning: Self-Evolving LLMs through Meta-Evaluation
di: Sui, Yuan, et al.
Pubblicazione: (2026) -
FiDeLiS: Faithful Reasoning in Large Language Model for Knowledge Graph Question Answering
di: Sui, Yuan, et al.
Pubblicazione: (2024) -
ConfTuner: Training Large Language Models to Express Their Confidence Verbally
di: Li, Yibo, et al.
Pubblicazione: (2025) -
AliMark: Enhancing Robustness of Sentence-Level Watermarking Against Text Paraphrasing
di: Li, Yuexin, et al.
Pubblicazione: (2026)