PFDial: A Structured Dialogue Instruction Fine-tuning Method Based on UML Flowcharts
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Zhang, Ming, Wang, Yuhui, Shen, Yujiong, Yang, Tingyi, Jiang, Changhao, Wu, Yilong, Dou, Shihan, Chen, Qinhao, Xi, Zhiheng, Zhang, Zhihao, Dong, Yi, Wang, Zhen, Fei, Zhihui, Wan, Mingyang, Liang, Tao, Ma, Guojun, Zhang, Qi, Gui, Tao, Huang, Xuanjing |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
TransferTOD: A Generalizable Chinese Multi-Domain Task-Oriented Dialogue System with Transfer Capabilities
par: Zhang, Ming, et autres
Publié: (2024)
par: Zhang, Ming, et autres
Publié: (2024)
JFTA-Bench: Evaluate LLM's Ability of Tracking and Analyzing Malfunctions Using Fault Trees
par: Wang, Yuhui, et autres
Publié: (2026)
par: Wang, Yuhui, et autres
Publié: (2026)
LLMEval-Med: A Real-world Clinical Benchmark for Medical LLMs with Physician Validation
par: Zhang, Ming, et autres
Publié: (2025)
par: Zhang, Ming, et autres
Publié: (2025)
LLMEval-Fair: A Large-Scale Longitudinal Study on Robust and Fair Evaluation of Large Language Models
par: Zhang, Ming, et autres
Publié: (2025)
par: Zhang, Ming, et autres
Publié: (2025)
Beyond Scaling: Measuring and Predicting the Upper Bound of Knowledge Retention in Language Model Pre-Training
par: Jiang, Changhao, et autres
Publié: (2025)
par: Jiang, Changhao, et autres
Publié: (2025)
RoCoIns: Enhancing Robustness of Large Language Models through Code-Style Instructions
par: Zhang, Yuansen, et autres
Publié: (2024)
par: Zhang, Yuansen, et autres
Publié: (2024)
LLMEval-Logic: A Solver-Verified Chinese Benchmark for Logical Reasoning of LLMs with Adversarial Hardening
par: Zhang, Ming, et autres
Publié: (2026)
par: Zhang, Ming, et autres
Publié: (2026)
From Scores to Preferences: Redefining MOS Benchmarking for Speech Quality Reward Modeling
par: Cao, Yifei, et autres
Publié: (2025)
par: Cao, Yifei, et autres
Publié: (2025)
ToolEyes: Fine-Grained Evaluation for Tool Learning Capabilities of Large Language Models in Real-world Scenarios
par: Ye, Junjie, et autres
Publié: (2024)
par: Ye, Junjie, et autres
Publié: (2024)
Steering LLMs via Scalable Interactive Oversight
par: Zhou, Enyu, et autres
Publié: (2026)
par: Zhou, Enyu, et autres
Publié: (2026)
Enhancing LLM-based Search Agents via Contribution Weighted Group Relative Policy Optimization
par: Wang, Junzhe, et autres
Publié: (2026)
par: Wang, Junzhe, et autres
Publié: (2026)
Improving RL Exploration for LLM Reasoning through Retrospective Replay
par: Dou, Shihan, et autres
Publié: (2025)
par: Dou, Shihan, et autres
Publié: (2025)
Unveiling Linguistic Regions in Large Language Models
par: Zhang, Zhihao, et autres
Publié: (2024)
par: Zhang, Zhihao, et autres
Publié: (2024)
Measuring Data Diversity for Instruction Tuning: A Systematic Analysis and A Reliable Metric
par: Yang, Yuming, et autres
Publié: (2025)
par: Yang, Yuming, et autres
Publié: (2025)
CodeChameleon: Personalized Encryption Framework for Jailbreaking Large Language Models
par: Lv, Huijie, et autres
Publié: (2024)
par: Lv, Huijie, et autres
Publié: (2024)
OpenNovelty: An LLM-powered Agentic System for Verifiable Scholarly Novelty Assessment
par: Zhang, Ming, et autres
Publié: (2026)
par: Zhang, Ming, et autres
Publié: (2026)
Muse: Towards Reproducible Long-Form Song Generation with Fine-Grained Style Control
par: Jiang, Changhao, et autres
Publié: (2026)
par: Jiang, Changhao, et autres
Publié: (2026)
SpeechRole: A Large-Scale Dataset and Benchmark for Evaluating Speech Role-Playing Agents
par: Jiang, Changhao, et autres
Publié: (2025)
par: Jiang, Changhao, et autres
Publié: (2025)
CMDAR: A Chinese Multi-scene Dynamic Audio Reasoning Benchmark with Diverse Challenges
par: Li, Hui, et autres
Publié: (2025)
par: Li, Hui, et autres
Publié: (2025)
Entropy Polarity in Reinforcement Fine-Tuning: Direction, Asymmetry, and Control
par: Zhang, Jiazheng, et autres
Publié: (2026)
par: Zhang, Jiazheng, et autres
Publié: (2026)
LLaMA Beyond English: An Empirical Study on Language Capability Transfer
par: Zhao, Jun, et autres
Publié: (2024)
par: Zhao, Jun, et autres
Publié: (2024)
Subspace Defense: Discarding Adversarial Perturbations by Learning a Subspace for Clean Signals
par: Zheng, Rui, et autres
Publié: (2024)
par: Zheng, Rui, et autres
Publié: (2024)
FRoM-W1: Towards General Humanoid Whole-Body Control with Language Instructions
par: Li, Peng, et autres
Publié: (2026)
par: Li, Peng, et autres
Publié: (2026)
Advancing Translation Preference Modeling with RLHF: A Step Towards Cost-Effective Solution
par: Xu, Nuo, et autres
Publié: (2024)
par: Xu, Nuo, et autres
Publié: (2024)
Mitigating Object Hallucinations in MLLMs via Multi-Frequency Perturbations
par: Li, Shuo, et autres
Publié: (2025)
par: Li, Shuo, et autres
Publié: (2025)
Compression Hacking: A Supplementary Perspective on Informatics Properties of Language Models from Geometric Distortion
par: Zang, Jianxiang, et autres
Publié: (2025)
par: Zang, Jianxiang, et autres
Publié: (2025)
MagicGUI: A Foundational Mobile GUI Agent with Scalable Data Pipeline and Reinforcement Fine-tuning
par: Tang, Liujian, et autres
Publié: (2025)
par: Tang, Liujian, et autres
Publié: (2025)
Unlocking the Essence of Beauty: Advanced Aesthetic Reasoning with Relative-Absolute Policy Optimization
par: Liu, Boyang, et autres
Publié: (2025)
par: Liu, Boyang, et autres
Publié: (2025)
Why Reinforcement Fine-Tuning Enables MLLMs Preserve Prior Knowledge Better: A Data Perspective
par: Zhang, Zhihao, et autres
Publié: (2025)
par: Zhang, Zhihao, et autres
Publié: (2025)
SciAgentGym: Benchmarking Multi-Step Scientific Tool-use in LLM Agents
par: Shen, Yujiong, et autres
Publié: (2026)
par: Shen, Yujiong, et autres
Publié: (2026)
Agentic Harness Engineering: Observability-Driven Automatic Evolution of Coding-Agent Harnesses
par: Lin, Jiahang, et autres
Publié: (2026)
par: Lin, Jiahang, et autres
Publié: (2026)
RMB: Comprehensively Benchmarking Reward Models in LLM Alignment
par: Zhou, Enyu, et autres
Publié: (2024)
par: Zhou, Enyu, et autres
Publié: (2024)
DFPO: Scaling Value Modeling via Distributional Flow towards Robust and Generalizable LLM Post-Training
par: Zhu, Dingwei, et autres
Publié: (2026)
par: Zhu, Dingwei, et autres
Publié: (2026)
Parrot: A Training Pipeline Enhances Both Program CoT and Natural Language CoT for Reasoning
par: Jin, Senjie, et autres
Publié: (2025)
par: Jin, Senjie, et autres
Publié: (2025)
Two Minds Better Than One: Collaborative Reward Modeling for LLM Alignment
par: Zhang, Jiazheng, et autres
Publié: (2025)
par: Zhang, Jiazheng, et autres
Publié: (2025)
60 Data Points are Sufficient to Fine-Tune LLMs for Question-Answering
par: Ye, Junjie, et autres
Publié: (2024)
par: Ye, Junjie, et autres
Publié: (2024)
Feedback-Driven Tool-Use Improvements in Large Language Models via Automated Build Environments
par: Ye, Junjie, et autres
Publié: (2025)
par: Ye, Junjie, et autres
Publié: (2025)
MM-Doc-R1: Training Agents for Long Document Visual Question Answering through Multi-turn Reinforcement Learning
par: Lin, Jiahang, et autres
Publié: (2026)
par: Lin, Jiahang, et autres
Publié: (2026)
Can Deep Research Agents Retrieve and Organize? Evaluating the Synthesis Gap with Expert Taxonomies
par: Zhang, Ming, et autres
Publié: (2026)
par: Zhang, Ming, et autres
Publié: (2026)
Demystifying Instruction Mixing for Fine-tuning Large Language Models
par: Wang, Renxi, et autres
Publié: (2023)
par: Wang, Renxi, et autres
Publié: (2023)
Documents similaires
-
TransferTOD: A Generalizable Chinese Multi-Domain Task-Oriented Dialogue System with Transfer Capabilities
par: Zhang, Ming, et autres
Publié: (2024) -
JFTA-Bench: Evaluate LLM's Ability of Tracking and Analyzing Malfunctions Using Fault Trees
par: Wang, Yuhui, et autres
Publié: (2026) -
LLMEval-Med: A Real-world Clinical Benchmark for Medical LLMs with Physician Validation
par: Zhang, Ming, et autres
Publié: (2025) -
LLMEval-Fair: A Large-Scale Longitudinal Study on Robust and Fair Evaluation of Large Language Models
par: Zhang, Ming, et autres
Publié: (2025) -
Beyond Scaling: Measuring and Predicting the Upper Bound of Knowledge Retention in Language Model Pre-Training
par: Jiang, Changhao, et autres
Publié: (2025)