CoAct: Co-Active LLM Preference Learning with Human-AI Synergy
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Xu, Ruiyao, Parmar, Mihir, Yang, Tiankai, Hu, Zhengyu, Zhao, Yue, Ding, Kaize |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
CoAct: A Global-Local Hierarchy for Autonomous Agent Collaboration
par: Hou, Xinming, et autres
Publié: (2024)
par: Hou, Xinming, et autres
Publié: (2024)
Cat-DPO: Category-Adaptive Safety Alignment
par: Yang, Tiankai, et autres
Publié: (2026)
par: Yang, Tiankai, et autres
Publié: (2026)
CoAct-1: Computer-using Multi-Agent System with Coding Actions
par: Song, Linxin, et autres
Publié: (2025)
par: Song, Linxin, et autres
Publié: (2025)
GNN-as-Judge: Unleashing the Power of LLMs for Graph Learning with GNN Feedback
par: Xu, Ruiyao, et autres
Publié: (2026)
par: Xu, Ruiyao, et autres
Publié: (2026)
No Attacker Needed: Unintentional Cross-User Contamination in Shared-State LLM Agents
par: Yang, Tiankai, et autres
Publié: (2026)
par: Yang, Tiankai, et autres
Publié: (2026)
AD-LLM: Benchmarking Large Language Models for Anomaly Detection
par: Yang, Tiankai, et autres
Publié: (2024)
par: Yang, Tiankai, et autres
Publié: (2024)
HopRank: Self-Supervised LLM Preference-Tuning on Graphs for Few-Shot Node Classification
par: Wang, Ziqing, et autres
Publié: (2026)
par: Wang, Ziqing, et autres
Publié: (2026)
Explaining Length Bias in LLM-Based Preference Evaluations
par: Hu, Zhengyu, et autres
Publié: (2024)
par: Hu, Zhengyu, et autres
Publié: (2024)
Towards Acyclic Preference Evaluation of Language Models via Multiple Evaluators
par: Hu, Zhengyu, et autres
Publié: (2024)
par: Hu, Zhengyu, et autres
Publié: (2024)
Large Language Models for Anomaly and Out-of-Distribution Detection: A Survey
par: Xu, Ruiyao, et autres
Publié: (2024)
par: Xu, Ruiyao, et autres
Publié: (2024)
CoCoA: Collaborative Chain-of-Agents for Parametric-Retrieved Knowledge Synergy
par: Jiang, Yi, et autres
Publié: (2025)
par: Jiang, Yi, et autres
Publié: (2025)
Task Vectors, Learned Not Extracted: Performance Gains and Mechanistic Insight
par: Yang, Haolin, et autres
Publié: (2025)
par: Yang, Haolin, et autres
Publié: (2025)
StealthRank: LLM Ranking Manipulation via Stealthy Prompt Optimization
par: Tang, Yiming, et autres
Publié: (2025)
par: Tang, Yiming, et autres
Publié: (2025)
Skywork-Reward-V2: Scaling Preference Data Curation via Human-AI Synergy
par: Liu, Chris Yuhao, et autres
Publié: (2025)
par: Liu, Chris Yuhao, et autres
Publié: (2025)
HumanLLM: Towards Personalized Understanding and Simulation of Human Nature
par: Lei, Yuxuan, et autres
Publié: (2026)
par: Lei, Yuxuan, et autres
Publié: (2026)
CoAuthorAI: A Human in the Loop System For Scientific Book Writing
par: Tian, Yangjie, et autres
Publié: (2026)
par: Tian, Yangjie, et autres
Publié: (2026)
Dissecting Human and LLM Preferences
par: Li, Junlong, et autres
Publié: (2024)
par: Li, Junlong, et autres
Publié: (2024)
OmniScientist: Toward a Co-evolving Ecosystem of Human and AI Scientists
par: Shao, Chenyang, et autres
Publié: (2025)
par: Shao, Chenyang, et autres
Publié: (2025)
CoCR-RAG: Enhancing Retrieval-Augmented Generation in Web Q&A via Concept-oriented Context Reconstruction
par: Shi, Kaize, et autres
Publié: (2026)
par: Shi, Kaize, et autres
Publié: (2026)
Population-Aligned Persona Generation for LLM-based Social Simulation
par: Hu, Zhengyu, et autres
Publié: (2025)
par: Hu, Zhengyu, et autres
Publié: (2025)
CoCoReviewBench: A Completeness- and Correctness-Oriented Benchmark for AI Reviewers
par: Deng, Hexuan, et autres
Publié: (2026)
par: Deng, Hexuan, et autres
Publié: (2026)
Exploring the Human-LLM Synergy in Advancing Theory-driven Qualitative Analysis
par: Meng, Han, et autres
Publié: (2024)
par: Meng, Han, et autres
Publié: (2024)
The Text Uncanny Valley: Non-Monotonic Performance Degradation in LLM Information Retrieval
par: Tong, Zekai, et autres
Publié: (2026)
par: Tong, Zekai, et autres
Publié: (2026)
Co-Evolving LLM Coder and Unit Tester via Reinforcement Learning
par: Wang, Yinjie, et autres
Publié: (2025)
par: Wang, Yinjie, et autres
Publié: (2025)
DS$^2$-Instruct: Domain-Specific Data Synthesis for Large Language Models Instruction Tuning
par: Xu, Ruiyao, et autres
Publié: (2026)
par: Xu, Ruiyao, et autres
Publié: (2026)
Nash CoT: Multi-Path Inference with Preference Equilibrium
par: Zhang, Ziqi, et autres
Publié: (2024)
par: Zhang, Ziqi, et autres
Publié: (2024)
Towards Autoformalization of LLM-generated Outputs for Requirement Verification
par: Gupte, Mihir, et autres
Publié: (2025)
par: Gupte, Mihir, et autres
Publié: (2025)
MIND: From Passive Mimicry to Active Reasoning through Capability-Aware Multi-Perspective CoT Distillation
par: Cui, Jin, et autres
Publié: (2026)
par: Cui, Jin, et autres
Publié: (2026)
NLP-ADBench: NLP Anomaly Detection Benchmark
par: Li, Yuangang, et autres
Publié: (2024)
par: Li, Yuangang, et autres
Publié: (2024)
Hybrid Preferences: Learning to Route Instances for Human vs. AI Feedback
par: Miranda, Lester James V., et autres
Publié: (2024)
par: Miranda, Lester James V., et autres
Publié: (2024)
CoEvolve: Training LLM Agents via Agent-Data Mutual Evolution
par: Yang, Shidong, et autres
Publié: (2026)
par: Yang, Shidong, et autres
Publié: (2026)
Synthetic Clinical Notes for Rare ICD Codes: A Data-Centric Framework for Long-Tail Medical Coding
par: Vo, Truong, et autres
Publié: (2025)
par: Vo, Truong, et autres
Publié: (2025)
Calibrate-Then-Act: Cost-Aware Exploration in LLM Agents
par: Ding, Wenxuan, et autres
Publié: (2026)
par: Ding, Wenxuan, et autres
Publié: (2026)
Human-AI Co-design for Clinical Prediction Models
par: Feng, Jean, et autres
Publié: (2026)
par: Feng, Jean, et autres
Publié: (2026)
LATTE: Forecasting Peer Anchored Preference Trajectories for Personalized LLM Generation
par: Li, Jinze, et autres
Publié: (2026)
par: Li, Jinze, et autres
Publié: (2026)
Human-AI Co-reasoning for Clinical Diagnosis with Evidence-Integrated Language Agent
par: Huang, Zhongzhen, et autres
Publié: (2026)
par: Huang, Zhongzhen, et autres
Publié: (2026)
A Survey on Human Preference Learning for Large Language Models
par: Jiang, Ruili, et autres
Publié: (2024)
par: Jiang, Ruili, et autres
Publié: (2024)
The Synergy Dilemma of Long-CoT SFT and RL: Investigating Post-Training Techniques for Reasoning VLMs
par: Chen, Jierun, et autres
Publié: (2025)
par: Chen, Jierun, et autres
Publié: (2025)
How Likely Do LLMs with CoT Mimic Human Reasoning?
par: Bao, Guangsheng, et autres
Publié: (2024)
par: Bao, Guangsheng, et autres
Publié: (2024)
The Strongest Teacher Is Not Always the Best Teacher: Student-Centric Answer Selection
par: Hu, Zhengyu, et autres
Publié: (2026)
par: Hu, Zhengyu, et autres
Publié: (2026)
Documents similaires
-
CoAct: A Global-Local Hierarchy for Autonomous Agent Collaboration
par: Hou, Xinming, et autres
Publié: (2024) -
Cat-DPO: Category-Adaptive Safety Alignment
par: Yang, Tiankai, et autres
Publié: (2026) -
CoAct-1: Computer-using Multi-Agent System with Coding Actions
par: Song, Linxin, et autres
Publié: (2025) -
GNN-as-Judge: Unleashing the Power of LLMs for Graph Learning with GNN Feedback
par: Xu, Ruiyao, et autres
Publié: (2026) -
No Attacker Needed: Unintentional Cross-User Contamination in Shared-State LLM Agents
par: Yang, Tiankai, et autres
Publié: (2026)