Self-Directed Synthetic Dialogues and Revisions Technical Report
Fuente:
arXiv
Salvato in:
| Autori principali: | Lambert, Nathan, Schoelkopf, Hailey, Gokaslan, Aaron, Soldaini, Luca, Pyatkin, Valentina, Castricato, Louis |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Suppressing Pink Elephants with Direct Principle Feedback
di: Castricato, Louis, et al.
Pubblicazione: (2024)
di: Castricato, Louis, et al.
Pubblicazione: (2024)
From Decoding to Meta-Generation: Inference-time Algorithms for Large Language Models
di: Welleck, Sean, et al.
Pubblicazione: (2024)
di: Welleck, Sean, et al.
Pubblicazione: (2024)
PolyPythias: Stability and Outliers across Fifty Language Model Pre-Training Runs
di: van der Wal, Oskar, et al.
Pubblicazione: (2025)
di: van der Wal, Oskar, et al.
Pubblicazione: (2025)
Teaching Models to Understand (but not Generate) High-risk Data
di: Wang, Ryan, et al.
Pubblicazione: (2025)
di: Wang, Ryan, et al.
Pubblicazione: (2025)
DiaSynth: Synthetic Dialogue Generation Framework for Low Resource Dialogue Applications
di: Suresh, Sathya Krishnan, et al.
Pubblicazione: (2024)
di: Suresh, Sathya Krishnan, et al.
Pubblicazione: (2024)
SFT-then-RL Outperforms Mixed-Policy Methods for LLM Reasoning
di: Limozin, Alexis, et al.
Pubblicazione: (2026)
di: Limozin, Alexis, et al.
Pubblicazione: (2026)
Description-Based Text Similarity
di: Ravfogel, Shauli, et al.
Pubblicazione: (2023)
di: Ravfogel, Shauli, et al.
Pubblicazione: (2023)
Why Has Predicting Downstream Capabilities of Frontier AI Models with Scale Remained Elusive?
di: Schaeffer, Rylan, et al.
Pubblicazione: (2024)
di: Schaeffer, Rylan, et al.
Pubblicazione: (2024)
The Diffusion Duality
di: Sahoo, Subham Sekhar, et al.
Pubblicazione: (2025)
di: Sahoo, Subham Sekhar, et al.
Pubblicazione: (2025)
Baichuan Alignment Technical Report
di: Lin, Mingan, et al.
Pubblicazione: (2024)
di: Lin, Mingan, et al.
Pubblicazione: (2024)
Megrez-Omni Technical Report
di: Li, Boxun, et al.
Pubblicazione: (2025)
di: Li, Boxun, et al.
Pubblicazione: (2025)
Big-Math: A Large-Scale, High-Quality Math Dataset for Reinforcement Learning in Language Models
di: Albalak, Alon, et al.
Pubblicazione: (2025)
di: Albalak, Alon, et al.
Pubblicazione: (2025)
Stable LM 2 1.6B Technical Report
di: Bellagente, Marco, et al.
Pubblicazione: (2024)
di: Bellagente, Marco, et al.
Pubblicazione: (2024)
Arcee Trinity Large Technical Report
di: Singh, Varun, et al.
Pubblicazione: (2026)
di: Singh, Varun, et al.
Pubblicazione: (2026)
TurnWise: The Gap between Single- and Multi-turn Language Model Capabilities
di: Graf, Victoria, et al.
Pubblicazione: (2026)
di: Graf, Victoria, et al.
Pubblicazione: (2026)
Meta-Reinforcement Learning with Self-Reflection for Agentic Search
di: Xiao, Teng, et al.
Pubblicazione: (2026)
di: Xiao, Teng, et al.
Pubblicazione: (2026)
KAT-Coder-V2 Technical Report
di: Li, Fengxiang, et al.
Pubblicazione: (2026)
di: Li, Fengxiang, et al.
Pubblicazione: (2026)
The Responsible Foundation Model Development Cheatsheet: A Review of Tools & Resources
di: Longpre, Shayne, et al.
Pubblicazione: (2024)
di: Longpre, Shayne, et al.
Pubblicazione: (2024)
H2O-Danube3 Technical Report
di: Pfeiffer, Pascal, et al.
Pubblicazione: (2024)
di: Pfeiffer, Pascal, et al.
Pubblicazione: (2024)
Simple and Effective Masked Diffusion Language Models
di: Sahoo, Subham Sekhar, et al.
Pubblicazione: (2024)
di: Sahoo, Subham Sekhar, et al.
Pubblicazione: (2024)
Dialogue Action Tokens: Steering Language Models in Goal-Directed Dialogue with a Multi-Turn Planner
di: Li, Kenneth, et al.
Pubblicazione: (2024)
di: Li, Kenneth, et al.
Pubblicazione: (2024)
Yi-Lightning Technical Report
di: Wake, Alan, et al.
Pubblicazione: (2024)
di: Wake, Alan, et al.
Pubblicazione: (2024)
Refined Direct Preference Optimization with Synthetic Data for Behavioral Alignment of LLMs
di: Gallego, Víctor
Pubblicazione: (2024)
di: Gallego, Víctor
Pubblicazione: (2024)
Synthetic Patient-Physician Dialogue Generation from Clinical Notes Using LLM
di: Das, Trisha, et al.
Pubblicazione: (2024)
di: Das, Trisha, et al.
Pubblicazione: (2024)
Evaluating the Performance of Large Language Models for SDG Mapping (Technical Report)
di: Yin, Hui, et al.
Pubblicazione: (2024)
di: Yin, Hui, et al.
Pubblicazione: (2024)
H2O-Danube-1.8B Technical Report
di: Singer, Philipp, et al.
Pubblicazione: (2024)
di: Singer, Philipp, et al.
Pubblicazione: (2024)
The Common Pile v0.1: An 8TB Dataset of Public Domain and Openly Licensed Text
di: Kandpal, Nikhil, et al.
Pubblicazione: (2025)
di: Kandpal, Nikhil, et al.
Pubblicazione: (2025)
Olmo Hybrid: From Theory to Practice and Back
di: Merrill, William, et al.
Pubblicazione: (2026)
di: Merrill, William, et al.
Pubblicazione: (2026)
The Zamba2 Suite: Technical Report
di: Glorioso, Paolo, et al.
Pubblicazione: (2024)
di: Glorioso, Paolo, et al.
Pubblicazione: (2024)
PLaMo 2 Technical Report
di: Networks, Preferred, et al.
Pubblicazione: (2025)
di: Networks, Preferred, et al.
Pubblicazione: (2025)
Trillion 7B Technical Report
di: Han, Sungjun, et al.
Pubblicazione: (2025)
di: Han, Sungjun, et al.
Pubblicazione: (2025)
Extracting memorized pieces of (copyrighted) books from open-weight language models
di: Cooper, A. Feder, et al.
Pubblicazione: (2025)
di: Cooper, A. Feder, et al.
Pubblicazione: (2025)
BitNet b1.58 2B4T Technical Report
di: Ma, Shuming, et al.
Pubblicazione: (2025)
di: Ma, Shuming, et al.
Pubblicazione: (2025)
Qwen2.5-Math Technical Report: Toward Mathematical Expert Model via Self-Improvement
di: Yang, An, et al.
Pubblicazione: (2024)
di: Yang, An, et al.
Pubblicazione: (2024)
Open Character Training: Shaping the Persona of AI Assistants through Constitutional AI
di: Maiya, Sharan, et al.
Pubblicazione: (2025)
di: Maiya, Sharan, et al.
Pubblicazione: (2025)
Hexa: Self-Improving for Knowledge-Grounded Dialogue System
di: Jo, Daejin, et al.
Pubblicazione: (2023)
di: Jo, Daejin, et al.
Pubblicazione: (2023)
Controllable Synthetic Clinical Note Generation with Privacy Guarantees
di: Baumel, Tal, et al.
Pubblicazione: (2024)
di: Baumel, Tal, et al.
Pubblicazione: (2024)
Distilled Self-Critique of LLMs with Synthetic Data: a Bayesian Perspective
di: Gallego, Victor
Pubblicazione: (2023)
di: Gallego, Victor
Pubblicazione: (2023)
Nemotron-4 15B Technical Report
di: Parmar, Jupinder, et al.
Pubblicazione: (2024)
di: Parmar, Jupinder, et al.
Pubblicazione: (2024)
Nemotron-4 340B Technical Report
di: Nvidia, et al.
Pubblicazione: (2024)
di: Nvidia, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Suppressing Pink Elephants with Direct Principle Feedback
di: Castricato, Louis, et al.
Pubblicazione: (2024) -
From Decoding to Meta-Generation: Inference-time Algorithms for Large Language Models
di: Welleck, Sean, et al.
Pubblicazione: (2024) -
PolyPythias: Stability and Outliers across Fifty Language Model Pre-Training Runs
di: van der Wal, Oskar, et al.
Pubblicazione: (2025) -
Teaching Models to Understand (but not Generate) High-risk Data
di: Wang, Ryan, et al.
Pubblicazione: (2025) -
DiaSynth: Synthetic Dialogue Generation Framework for Low Resource Dialogue Applications
di: Suresh, Sathya Krishnan, et al.
Pubblicazione: (2024)