Policy Learning with a Natural Language Action Space: A Causal Approach
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Zhang, Bohan, Wang, Yixin, Dhillon, Paramveer S. |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Causal Inference for Human-Language Model Collaboration
par: Zhang, Bohan, et autres
Publié: (2024)
par: Zhang, Bohan, et autres
Publié: (2024)
Can Good Writing Be Generative? Expert-Level AI Writing Emerges through Fine-Tuning on High-Quality Books
par: Chakrabarty, Tuhin, et autres
Publié: (2026)
par: Chakrabarty, Tuhin, et autres
Publié: (2026)
Who Owns the Text? Design Patterns for Preserving Authorship in AI-Assisted Writing
par: Zhang, Bohan, et autres
Publié: (2026)
par: Zhang, Bohan, et autres
Publié: (2026)
Readers Prefer Outputs of AI Trained on Copyrighted Books over Expert Human Writers
par: Chakrabarty, Tuhin, et autres
Publié: (2025)
par: Chakrabarty, Tuhin, et autres
Publié: (2025)
Dual Debiasing for Noisy In-Context Learning for Text Generation
par: Liang, Siqi, et autres
Publié: (2025)
par: Liang, Siqi, et autres
Publié: (2025)
Shaping Human-AI Collaboration: Varied Scaffolding Levels in Co-writing with Language Models
par: Dhillon, Paramveer S., et autres
Publié: (2024)
par: Dhillon, Paramveer S., et autres
Publié: (2024)
Natural Language Actor-Critic: Scalable Off-Policy Learning in Language Space
par: Hong, Joey, et autres
Publié: (2025)
par: Hong, Joey, et autres
Publié: (2025)
Characterizing the Structure of Online Conversations Across Reddit
par: Yu, Yulin, et autres
Publié: (2022)
par: Yu, Yulin, et autres
Publié: (2022)
Quantifying and Mitigating Unimodal Biases in Multimodal Large Language Models: A Causal Perspective
par: Chen, Meiqi, et autres
Publié: (2024)
par: Chen, Meiqi, et autres
Publié: (2024)
Recommendation and Temptation
par: Anwar, Md Sanzeed, et autres
Publié: (2024)
par: Anwar, Md Sanzeed, et autres
Publié: (2024)
Learning Agentic Policy from Action Guidance
par: Ji, Yuxiang, et autres
Publié: (2026)
par: Ji, Yuxiang, et autres
Publié: (2026)
Isolated Causal Effects of Natural Language
par: Lin, Victoria, et autres
Publié: (2024)
par: Lin, Victoria, et autres
Publié: (2024)
Learning to Ponder: Adaptive Reasoning in Latent Space
par: He, Yixin, et autres
Publié: (2025)
par: He, Yixin, et autres
Publié: (2025)
Filter Bubble or Homogenization? Disentangling the Long-Term Effects of Recommendations on User Consumption Patterns
par: Anwar, Md Sanzeed, et autres
Publié: (2024)
par: Anwar, Md Sanzeed, et autres
Publié: (2024)
Causality for Natural Language Processing
par: Jin, Zhijing
Publié: (2025)
par: Jin, Zhijing
Publié: (2025)
Predictability and Causality in Spanish and English Natural Language Generation
par: Busto-Castiñeira, Andrea, et autres
Publié: (2024)
par: Busto-Castiñeira, Andrea, et autres
Publié: (2024)
Natural Language Processing of Privacy Policies: A Survey
par: Adhikari, Andrick, et autres
Publié: (2025)
par: Adhikari, Andrick, et autres
Publié: (2025)
Signals in the Noise: Decoding Unexpected Engagement Patterns on Twitter
par: Yu, Yulin, et autres
Publié: (2025)
par: Yu, Yulin, et autres
Publié: (2025)
Striking a Balance between Classical and Deep Learning Approaches in Natural Language Processing Pedagogy
par: Joshi, Aditya, et autres
Publié: (2024)
par: Joshi, Aditya, et autres
Publié: (2024)
Natural Language Tools: A Natural Language Approach to Tool Calling In Large Language Agents
par: Johnson, Reid T., et autres
Publié: (2025)
par: Johnson, Reid T., et autres
Publié: (2025)
LLMs Are Prone to Fallacies in Causal Inference
par: Joshi, Nitish, et autres
Publié: (2024)
par: Joshi, Nitish, et autres
Publié: (2024)
Off-Policy Value-Based Reinforcement Learning for Large Language Models
par: Wang, Peng-Yuan, et autres
Publié: (2026)
par: Wang, Peng-Yuan, et autres
Publié: (2026)
Joint Action Language Modelling for Transparent Policy Execution
par: Wulff, Theodor, et autres
Publié: (2025)
par: Wulff, Theodor, et autres
Publié: (2025)
SRPO: Self-Referential Policy Optimization for Vision-Language-Action Models
par: Fei, Senyu, et autres
Publié: (2025)
par: Fei, Senyu, et autres
Publié: (2025)
Causal Reasoning in Large Language Models: A Knowledge Graph Approach
par: Kim, Yejin, et autres
Publié: (2024)
par: Kim, Yejin, et autres
Publié: (2024)
Policy Compliance of User Requests in Natural Language for AI Systems
par: Cisneros-Velarde, Pedro
Publié: (2026)
par: Cisneros-Velarde, Pedro
Publié: (2026)
Synergizing Machine Learning & Symbolic Methods: A Survey on Hybrid Approaches to Natural Language Processing
par: Panchendrarajan, Rrubaa, et autres
Publié: (2024)
par: Panchendrarajan, Rrubaa, et autres
Publié: (2024)
GAPD: Gold-Action Policy Distillation for Agentic Reinforcement Learning in Knowledge Base Question Answering
par: Sun, Xin, et autres
Publié: (2026)
par: Sun, Xin, et autres
Publié: (2026)
From Planning to Revision: How AI Writing Support at Different Stages Alters Ownership
par: Gero, Katy Ilonka, et autres
Publié: (2026)
par: Gero, Katy Ilonka, et autres
Publié: (2026)
A Novel Approach to Eliminating Hallucinations in Large Language Model-Assisted Causal Discovery
par: Sng, Grace, et autres
Publié: (2024)
par: Sng, Grace, et autres
Publié: (2024)
Automatic Extraction of Relationships among Motivations, Emotions and Actions from Natural Language Texts
par: Yang, Fei
Publié: (2024)
par: Yang, Fei
Publié: (2024)
UniCode: Learning a Unified Codebook for Multimodal Large Language Models
par: Zheng, Sipeng, et autres
Publié: (2024)
par: Zheng, Sipeng, et autres
Publié: (2024)
Causally-Enhanced Reinforcement Policy Optimization
par: Wang, Xiangqi, et autres
Publié: (2025)
par: Wang, Xiangqi, et autres
Publié: (2025)
DynHD: Hallucination Detection for Diffusion Large Language Models via Denoising Dynamics Deviation Learning
par: Qian, Yanyu, et autres
Publié: (2026)
par: Qian, Yanyu, et autres
Publié: (2026)
Com$^2$: A Causal-Guided Benchmark for Exploring Complex Commonsense Reasoning in Large Language Models
par: Xiong, Kai, et autres
Publié: (2025)
par: Xiong, Kai, et autres
Publié: (2025)
A Causal Explainable Guardrails for Large Language Models
par: Chu, Zhixuan, et autres
Publié: (2024)
par: Chu, Zhixuan, et autres
Publié: (2024)
Understanding Reference Policies in Direct Preference Optimization
par: Liu, Yixin, et autres
Publié: (2024)
par: Liu, Yixin, et autres
Publié: (2024)
ExAnte: A Benchmark for Ex-Ante Inference in Large Language Models
par: Liu, Yachuan, et autres
Publié: (2025)
par: Liu, Yachuan, et autres
Publié: (2025)
A Structured Literature Review on Traditional Approaches in Current Natural Language Processing
par: Jegan, Robin, et autres
Publié: (2025)
par: Jegan, Robin, et autres
Publié: (2025)
Fostering Natural Conversation in Large Language Models with NICO: a Natural Interactive COnversation dataset
par: Sun, Renliang, et autres
Publié: (2024)
par: Sun, Renliang, et autres
Publié: (2024)
Documents similaires
-
Causal Inference for Human-Language Model Collaboration
par: Zhang, Bohan, et autres
Publié: (2024) -
Can Good Writing Be Generative? Expert-Level AI Writing Emerges through Fine-Tuning on High-Quality Books
par: Chakrabarty, Tuhin, et autres
Publié: (2026) -
Who Owns the Text? Design Patterns for Preserving Authorship in AI-Assisted Writing
par: Zhang, Bohan, et autres
Publié: (2026) -
Readers Prefer Outputs of AI Trained on Copyrighted Books over Expert Human Writers
par: Chakrabarty, Tuhin, et autres
Publié: (2025) -
Dual Debiasing for Noisy In-Context Learning for Text Generation
par: Liang, Siqi, et autres
Publié: (2025)