On the Effects of Fine-tuning Language Models for Text-Based Reinforcement Learning
Fuente:
arXiv
Salvato in:
| Autori principali: | Gruppi, Mauricio, Dan, Soham, Murugesan, Keerthiram, Chaudhury, Subhajit |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
EXPLORER: Exploration-guided Reasoning for Textual Reinforcement Learning
di: Basu, Kinjal, et al.
Pubblicazione: (2024)
di: Basu, Kinjal, et al.
Pubblicazione: (2024)
Language Guided Exploration for RL Agents in Text Environments
di: Golchha, Hitesh, et al.
Pubblicazione: (2024)
di: Golchha, Hitesh, et al.
Pubblicazione: (2024)
STARLING: Self-supervised Training of Text-based Reinforcement Learning Agent with Large Language Models
di: Basavatia, Shreyas, et al.
Pubblicazione: (2024)
di: Basavatia, Shreyas, et al.
Pubblicazione: (2024)
Needle in the Haystack for Memory Based Large Language Models
di: Nelson, Elliot, et al.
Pubblicazione: (2024)
di: Nelson, Elliot, et al.
Pubblicazione: (2024)
CTBench: A Comprehensive Benchmark for Evaluating Language Model Capabilities in Clinical Trial Design
di: Neehal, Nafis, et al.
Pubblicazione: (2024)
di: Neehal, Nafis, et al.
Pubblicazione: (2024)
ZoomR: Memory Efficient Reasoning through Multi-Granularity Key Value Retrieval
di: Yang, David H., et al.
Pubblicazione: (2026)
di: Yang, David H., et al.
Pubblicazione: (2026)
Tracking the Temporal Dynamics of News Coverage of Catastrophic and Violent Events
di: Lugos, Emily, et al.
Pubblicazione: (2026)
di: Lugos, Emily, et al.
Pubblicazione: (2026)
Towards Aligning Language Models with Textual Feedback
di: Lloret, Saüc Abadal, et al.
Pubblicazione: (2024)
di: Lloret, Saüc Abadal, et al.
Pubblicazione: (2024)
Cross-Examiner: Evaluating Consistency of Large Language Model-Generated Explanations
di: Villa, Danielle, et al.
Pubblicazione: (2025)
di: Villa, Danielle, et al.
Pubblicazione: (2025)
Large Language Models can be Strong Self-Detoxifiers
di: Ko, Ching-Yun, et al.
Pubblicazione: (2024)
di: Ko, Ching-Yun, et al.
Pubblicazione: (2024)
Breaking mBad! Supervised Fine-tuning for Cross-Lingual Detoxification
di: Beniwal, Himanshu, et al.
Pubblicazione: (2025)
di: Beniwal, Himanshu, et al.
Pubblicazione: (2025)
SentinelLMs: Encrypted Input Adaptation and Fine-tuning of Language Models for Private and Secure Inference
di: Mishra, Abhijit, et al.
Pubblicazione: (2023)
di: Mishra, Abhijit, et al.
Pubblicazione: (2023)
Improving Text Embeddings for Smaller Language Models Using Contrastive Fine-tuning
di: Ukarapol, Trapoom, et al.
Pubblicazione: (2024)
di: Ukarapol, Trapoom, et al.
Pubblicazione: (2024)
Generation Constraint Scaling Can Mitigate Hallucination
di: Kollias, Georgios, et al.
Pubblicazione: (2024)
di: Kollias, Georgios, et al.
Pubblicazione: (2024)
Mitigating Gradient Bias in Multi-objective Learning: A Provably Convergent Stochastic Approach
di: Fernando, Heshan, et al.
Pubblicazione: (2022)
di: Fernando, Heshan, et al.
Pubblicazione: (2022)
Can Memory-Augmented Language Models Generalize on Reasoning-in-a-Haystack Tasks?
di: Das, Payel, et al.
Pubblicazione: (2025)
di: Das, Payel, et al.
Pubblicazione: (2025)
AI Generated Text Detection Using Instruction Fine-tuned Large Language and Transformer-Based Models
di: Guggilla, Chinnappa, et al.
Pubblicazione: (2025)
di: Guggilla, Chinnappa, et al.
Pubblicazione: (2025)
MEDVOC: Vocabulary Adaptation for Fine-tuning Pre-trained Language Models on Medical Text Summarization
di: Balde, Gunjan, et al.
Pubblicazione: (2024)
di: Balde, Gunjan, et al.
Pubblicazione: (2024)
How Green are Neural Language Models? Analyzing Energy Consumption in Text Summarization Fine-tuning
di: Rehman, Tohida, et al.
Pubblicazione: (2025)
di: Rehman, Tohida, et al.
Pubblicazione: (2025)
Fine-tuning Large Language Models with Sequential Instructions
di: Hu, Hanxu, et al.
Pubblicazione: (2024)
di: Hu, Hanxu, et al.
Pubblicazione: (2024)
Sparse Matrix in Large Language Model Fine-tuning
di: He, Haoze, et al.
Pubblicazione: (2024)
di: He, Haoze, et al.
Pubblicazione: (2024)
API-BLEND: A Comprehensive Corpora for Training and Benchmarking API LLMs
di: Basu, Kinjal, et al.
Pubblicazione: (2024)
di: Basu, Kinjal, et al.
Pubblicazione: (2024)
Mitigating Misalignment Contagion by Steering with Implicit Traits
di: Chang, Maria, et al.
Pubblicazione: (2026)
di: Chang, Maria, et al.
Pubblicazione: (2026)
MiLoRA: Efficient Mixture of Low-Rank Adaptation for Large Language Models Fine-tuning
di: Zhang, Jingfan, et al.
Pubblicazione: (2024)
di: Zhang, Jingfan, et al.
Pubblicazione: (2024)
NG-Router: Graph-Supervised Multi-Agent Collaboration for Nutrition Question Answering
di: Shi, Kaiwen, et al.
Pubblicazione: (2025)
di: Shi, Kaiwen, et al.
Pubblicazione: (2025)
Resource-Efficient Adaptation of Large Language Models for Text Embeddings via Prompt Engineering and Contrastive Fine-tuning
di: Roth, Benedikt, et al.
Pubblicazione: (2025)
di: Roth, Benedikt, et al.
Pubblicazione: (2025)
Fine-tuning Large Language Models for Multigenerator, Multidomain, and Multilingual Machine-Generated Text Detection
di: Xiong, Feng, et al.
Pubblicazione: (2024)
di: Xiong, Feng, et al.
Pubblicazione: (2024)
Advancing Single and Multi-task Text Classification through Large Language Model Fine-tuning
di: Zhao, Hang, et al.
Pubblicazione: (2024)
di: Zhao, Hang, et al.
Pubblicazione: (2024)
Assertion Detection Large Language Model In-context Learning LoRA Fine-tuning
di: Ji, Yuelyu, et al.
Pubblicazione: (2024)
di: Ji, Yuelyu, et al.
Pubblicazione: (2024)
Vocabulary-level Memory Efficiency for Language Model Fine-tuning
di: Williams, Miles, et al.
Pubblicazione: (2023)
di: Williams, Miles, et al.
Pubblicazione: (2023)
Investigating the Representation of Backchannels and Fillers in Fine-tuned Language Models
di: Wang, Yu, et al.
Pubblicazione: (2025)
di: Wang, Yu, et al.
Pubblicazione: (2025)
Beyond Demographics: Fine-tuning Large Language Models to Predict Individuals' Subjective Text Perceptions
di: Orlikowski, Matthias, et al.
Pubblicazione: (2025)
di: Orlikowski, Matthias, et al.
Pubblicazione: (2025)
RIFF: Learning to Rephrase Inputs for Few-shot Fine-tuning of Language Models
di: Najafi, Saeed, et al.
Pubblicazione: (2024)
di: Najafi, Saeed, et al.
Pubblicazione: (2024)
Semi-supervised Fine-tuning for Large Language Models
di: Luo, Junyu, et al.
Pubblicazione: (2024)
di: Luo, Junyu, et al.
Pubblicazione: (2024)
Stage-wise Fine-tuning for Graph-to-Text Generation
di: Wang, Qingyun, et al.
Pubblicazione: (2021)
di: Wang, Qingyun, et al.
Pubblicazione: (2021)
Detecting Bias in Large Language Models: Fine-tuned KcBERT
di: Lee, J. K., et al.
Pubblicazione: (2024)
di: Lee, J. K., et al.
Pubblicazione: (2024)
Disentangling Reasoning Tokens and Boilerplate Tokens For Language Model Fine-tuning
di: Ye, Ziang, et al.
Pubblicazione: (2024)
di: Ye, Ziang, et al.
Pubblicazione: (2024)
Full Parameter Fine-tuning for Large Language Models with Limited Resources
di: Lv, Kai, et al.
Pubblicazione: (2023)
di: Lv, Kai, et al.
Pubblicazione: (2023)
Preference-grounded Token-level Guidance for Language Model Fine-tuning
di: Yang, Shentao, et al.
Pubblicazione: (2023)
di: Yang, Shentao, et al.
Pubblicazione: (2023)
Fine-tuning vs. In-context Learning in Large Language Models: A Formal Language Learning Perspective
di: Ghosh, Bishwamittra, et al.
Pubblicazione: (2026)
di: Ghosh, Bishwamittra, et al.
Pubblicazione: (2026)
Documenti analoghi
-
EXPLORER: Exploration-guided Reasoning for Textual Reinforcement Learning
di: Basu, Kinjal, et al.
Pubblicazione: (2024) -
Language Guided Exploration for RL Agents in Text Environments
di: Golchha, Hitesh, et al.
Pubblicazione: (2024) -
STARLING: Self-supervised Training of Text-based Reinforcement Learning Agent with Large Language Models
di: Basavatia, Shreyas, et al.
Pubblicazione: (2024) -
Needle in the Haystack for Memory Based Large Language Models
di: Nelson, Elliot, et al.
Pubblicazione: (2024) -
CTBench: A Comprehensive Benchmark for Evaluating Language Model Capabilities in Clinical Trial Design
di: Neehal, Nafis, et al.
Pubblicazione: (2024)