Igniting Creative Writing in Small Language Models: LLM-as-a-Judge versus Multi-Agent Refined Rewards
Fuente:
arXiv
Saved in:
| Main Authors: | Wei, Xiaolong, Lu, Bo, Zhang, Xingyu, Zhao, Zhejun, Shen, Dongdong, Xia, Long, Yin, Dawei |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Beyond ReAct: A Planner-Centric Framework for Complex Tool-Augmented LLM Reasoning
by: Wei, Xiaolong, et al.
Published: (2025)
by: Wei, Xiaolong, et al.
Published: (2025)
TURA: Tool-Augmented Unified Retrieval Agent for AI Search
by: Zhao, Zhejun, et al.
Published: (2025)
by: Zhao, Zhejun, et al.
Published: (2025)
UniCreative: Unifying Long-form Logic and Short-form Sparkle via Reference-Free Reinforcement Learning
by: Wei, Xiaolong, et al.
Published: (2026)
by: Wei, Xiaolong, et al.
Published: (2026)
Ignite Forecasting with SPARK: An Efficient Generative Framework for Refining LLMs in Temporal Knowledge Graph Forecasting
by: Yin, Gongzhu, et al.
Published: (2025)
by: Yin, Gongzhu, et al.
Published: (2025)
LLM Review: Enhancing Creative Writing via Blind Peer Review Feedback
by: Li, Weiyue, et al.
Published: (2026)
by: Li, Weiyue, et al.
Published: (2026)
RLMR: Reinforcement Learning with Mixed Rewards for Creative Writing
by: Liao, Jianxing, et al.
Published: (2025)
by: Liao, Jianxing, et al.
Published: (2025)
JAILJUDGE: A Comprehensive Jailbreak Judge Benchmark with Multi-Agent Enhanced Explanation Evaluation Framework
by: Liu, Fan, et al.
Published: (2024)
by: Liu, Fan, et al.
Published: (2024)
Creative Writing in the Language Arts.
by: Ediger, Marlow
Published: (1994)
by: Ediger, Marlow
Published: (1994)
MM-StanceDet: Retrieval-Augmented Multi-modal Multi-agent Stance Detection
by: Lu, Weihai, et al.
Published: (2026)
by: Lu, Weihai, et al.
Published: (2026)
CPJ: Explainable Agricultural Pest Diagnosis via Caption-Prompt-Judge with LLM-Judged Refinement
by: Zhang, Wentao, et al.
Published: (2025)
by: Zhang, Wentao, et al.
Published: (2025)
Memory-Augmented Reinforcement Learning Agent for CAD Generation
by: Xiaolong, Yin, et al.
Published: (2026)
by: Xiaolong, Yin, et al.
Published: (2026)
Med-RewardBench: Benchmarking Reward Models and Judges for Medical Multimodal Large Language Models
by: Ding, Meidan, et al.
Published: (2025)
by: Ding, Meidan, et al.
Published: (2025)
AdaJudge: Adaptive Multi-Perspective Judging for Reward Modeling
by: Miao, Yongliang, et al.
Published: (2026)
by: Miao, Yongliang, et al.
Published: (2026)
Mount Etna Ignites
by: Pinna, Marco
Published: (2002)
by: Pinna, Marco
Published: (2002)
Creative Writing.
by: Mitchell, Roger, Ed., et al.
Published: (1996)
by: Mitchell, Roger, Ed., et al.
Published: (1996)
Auditing Multi-Agent LLM Reasoning Trees Outperforms Majority Vote and LLM-as-Judge
by: Yang, Wei, et al.
Published: (2026)
by: Yang, Wei, et al.
Published: (2026)
Ask a Strong LLM Judge when Your Reward Model is Uncertain
by: Xu, Zhenghao, et al.
Published: (2025)
by: Xu, Zhenghao, et al.
Published: (2025)
Multi-Agent-as-Judge: Aligning LLM-Agent-Based Automated Evaluation with Multi-Dimensional Human Evaluation
by: Chen, Jiaju, et al.
Published: (2025)
by: Chen, Jiaju, et al.
Published: (2025)
Multi-Modal Multi-Behavior Sequential Recommendation with Conditional Diffusion-Based Feature Denoising
by: Cui, Xiaoxi, et al.
Published: (2025)
by: Cui, Xiaoxi, et al.
Published: (2025)
Igniting VLMs toward the Embodied Space
by: Zhai, Andy, et al.
Published: (2025)
by: Zhai, Andy, et al.
Published: (2025)
GRAF: Multi-turn Jailbreaking via Global Refinement and Active Fabrication
by: Tang, Hua, et al.
Published: (2025)
by: Tang, Hua, et al.
Published: (2025)
Reward-Driven Interaction: Enhancing Proactive Dialogue Agents through User Satisfaction Prediction
by: Shen, Wei, et al.
Published: (2025)
by: Shen, Wei, et al.
Published: (2025)
Effects of Trade Liberalization on Health: Evidence From the Size of Trading Networks
by: Cheuk Yin Ho, et al.
Published: (2026)
by: Cheuk Yin Ho, et al.
Published: (2026)
Sentient Agent as a Judge: Evaluating Higher-Order Social Cognition in Large Language Models
by: Zhang, Bang, et al.
Published: (2025)
by: Zhang, Bang, et al.
Published: (2025)
PentestAgent: Incorporating LLM Agents to Automated Penetration Testing
by: Shen, Xiangmin, et al.
Published: (2024)
by: Shen, Xiangmin, et al.
Published: (2024)
Meta-Rewarding Language Models: Self-Improving Alignment with LLM-as-a-Meta-Judge
by: Wu, Tianhao, et al.
Published: (2024)
by: Wu, Tianhao, et al.
Published: (2024)
Creative Beam Search: LLM-as-a-Judge For Improving Response Generation
by: Franceschelli, Giorgio, et al.
Published: (2024)
by: Franceschelli, Giorgio, et al.
Published: (2024)
R-Judge: Benchmarking Safety Risk Awareness for LLM Agents
by: Yuan, Tongxin, et al.
Published: (2024)
by: Yuan, Tongxin, et al.
Published: (2024)
Reinforcing Multi-Turn Reasoning in LLM Agents via Turn-Level Reward Design
by: Wei, Quan, et al.
Published: (2025)
by: Wei, Quan, et al.
Published: (2025)
Teaching Creative Writing.
Published: (1974)
Published: (1974)
Creativity in LLM-based Multi-Agent Systems: A Survey
by: Lin, Yi-Cheng, et al.
Published: (2025)
by: Lin, Yi-Cheng, et al.
Published: (2025)
Multi-Agent Debate for LLM Judges with Adaptive Stability Detection
by: Hu, Tianyu, et al.
Published: (2025)
by: Hu, Tianyu, et al.
Published: (2025)
A Baseline $T\log^2 T$ Upper Bound for KL-Regularized Prime--Zero Optimal Transport
by: Yang, Zhejun
Published: (2025)
by: Yang, Zhejun
Published: (2025)
HiGPT: Heterogeneous Graph Language Model
by: Tang, Jiabin, et al.
Published: (2024)
by: Tang, Jiabin, et al.
Published: (2024)
SPARK: Igniting Communication-Efficient Decentralized Learning via Stage-wise Projected NTK and Accelerated Regularization
by: Xia, Li
Published: (2025)
by: Xia, Li
Published: (2025)
Refinement Provenance Inference: Detecting LLM-Refined Training Prompts from Model Behavior
by: Yin, Bo, et al.
Published: (2026)
by: Yin, Bo, et al.
Published: (2026)
Rethinking LLM-as-a-Judge: Representation-as-a-Judge with Small Language Models via Semantic Capacity Asymmetry
by: Li, Zhuochun, et al.
Published: (2026)
by: Li, Zhuochun, et al.
Published: (2026)
RF-Agent: Automated Reward Function Design via Language Agent Tree Search
by: Gao, Ning, et al.
Published: (2026)
by: Gao, Ning, et al.
Published: (2026)
Rethinking Rubric Generation for Improving LLM Judge and Reward Modeling for Open-ended Tasks
by: Shen, William F., et al.
Published: (2026)
by: Shen, William F., et al.
Published: (2026)
Diffusion-based Multi-modal Synergy Interest Network for Click-through Rate Prediction
by: Cui, Xiaoxi, et al.
Published: (2025)
by: Cui, Xiaoxi, et al.
Published: (2025)
Similar Items
-
Beyond ReAct: A Planner-Centric Framework for Complex Tool-Augmented LLM Reasoning
by: Wei, Xiaolong, et al.
Published: (2025) -
TURA: Tool-Augmented Unified Retrieval Agent for AI Search
by: Zhao, Zhejun, et al.
Published: (2025) -
UniCreative: Unifying Long-form Logic and Short-form Sparkle via Reference-Free Reinforcement Learning
by: Wei, Xiaolong, et al.
Published: (2026) -
Ignite Forecasting with SPARK: An Efficient Generative Framework for Refining LLMs in Temporal Knowledge Graph Forecasting
by: Yin, Gongzhu, et al.
Published: (2025) -
LLM Review: Enhancing Creative Writing via Blind Peer Review Feedback
by: Li, Weiyue, et al.
Published: (2026)