Salvato in:
| Autori principali: | Wen, Jiaxin, Zhong, Ruiqi, Ke, Pei, Shao, Zhihong, Wang, Hongning, Huang, Minlie |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | https://arxiv.org/abs/2406.04604 |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Language Model Decoding as Direct Metrics Optimization
di: Ji, Haozhe, et al.
Pubblicazione: (2023)
di: Ji, Haozhe, et al.
Pubblicazione: (2023)
Unlocking Reasoning Potential in Large Langauge Models by Scaling Code-form Planning
di: Wen, Jiaxin, et al.
Pubblicazione: (2024)
di: Wen, Jiaxin, et al.
Pubblicazione: (2024)
Defending Large Language Models Against Jailbreaking Attacks Through Goal Prioritization
di: Zhang, Zhexin, et al.
Pubblicazione: (2023)
di: Zhang, Zhexin, et al.
Pubblicazione: (2023)
Language Models Learn to Mislead Humans via RLHF
di: Wen, Jiaxin, et al.
Pubblicazione: (2024)
di: Wen, Jiaxin, et al.
Pubblicazione: (2024)
IF-RewardBench: Benchmarking Judge Models for Instruction-Following Evaluation
di: Wen, Bosi, et al.
Pubblicazione: (2026)
di: Wen, Bosi, et al.
Pubblicazione: (2026)
HPSS: Heuristic Prompting Strategy Search for LLM Evaluators
di: Wen, Bosi, et al.
Pubblicazione: (2025)
di: Wen, Bosi, et al.
Pubblicazione: (2025)
IF-CRITIC: Towards a Fine-Grained LLM Critic for Instruction-Following Evaluation
di: Wen, Bosi, et al.
Pubblicazione: (2025)
di: Wen, Bosi, et al.
Pubblicazione: (2025)
Towards Efficient Exact Optimization of Language Model Alignment
di: Ji, Haozhe, et al.
Pubblicazione: (2024)
di: Ji, Haozhe, et al.
Pubblicazione: (2024)
Black-Box Prompt Optimization: Aligning Large Language Models without Model Training
di: Cheng, Jiale, et al.
Pubblicazione: (2023)
di: Cheng, Jiale, et al.
Pubblicazione: (2023)
AMOR: A Recipe for Building Adaptable Modular Knowledge Agents Through Process Feedback
di: Guan, Jian, et al.
Pubblicazione: (2024)
di: Guan, Jian, et al.
Pubblicazione: (2024)
RLAR: An Agentic Reward System for Multi-task Reinforcement Learning on Large Language Models
di: Feng, Andrew Zhuoer, et al.
Pubblicazione: (2026)
di: Feng, Andrew Zhuoer, et al.
Pubblicazione: (2026)
From Theft to Bomb-Making: The Ripple Effect of Unlearning in Defending Against Jailbreak Attacks
di: Zhang, Zhexin, et al.
Pubblicazione: (2024)
di: Zhang, Zhexin, et al.
Pubblicazione: (2024)
Benchmarking Complex Instruction-Following with Multiple Constraints Composition
di: Wen, Bosi, et al.
Pubblicazione: (2024)
di: Wen, Bosi, et al.
Pubblicazione: (2024)
ShieldLM: Empowering LLMs as Aligned, Customizable and Explainable Safety Detectors
di: Zhang, Zhexin, et al.
Pubblicazione: (2024)
di: Zhang, Zhexin, et al.
Pubblicazione: (2024)
Think Socially via Cognitive Reasoning
di: Zhou, Jinfeng, et al.
Pubblicazione: (2025)
di: Zhou, Jinfeng, et al.
Pubblicazione: (2025)
AutoCode: LLMs as Problem Setters for Competitive Programming
di: Zhou, Shang, et al.
Pubblicazione: (2025)
di: Zhou, Shang, et al.
Pubblicazione: (2025)
Scaling Code-Assisted Chain-of-Thoughts and Instructions for Model Reasoning
di: Lin, Honglin, et al.
Pubblicazione: (2025)
di: Lin, Honglin, et al.
Pubblicazione: (2025)
AutoDetect: Towards a Unified Framework for Automated Weakness Detection in Large Language Models
di: Cheng, Jiale, et al.
Pubblicazione: (2024)
di: Cheng, Jiale, et al.
Pubblicazione: (2024)
Data Selection via Optimal Control for Language Models
di: Gu, Yuxian, et al.
Pubblicazione: (2024)
di: Gu, Yuxian, et al.
Pubblicazione: (2024)
Agent-SafetyBench: Evaluating the Safety of LLM Agents
di: Zhang, Zhexin, et al.
Pubblicazione: (2024)
di: Zhang, Zhexin, et al.
Pubblicazione: (2024)
Be Careful When Fine-tuning On Open-Source LLMs: Your Fine-tuning Data Could Be Secretly Stolen!
di: Zhang, Zhexin, et al.
Pubblicazione: (2025)
di: Zhang, Zhexin, et al.
Pubblicazione: (2025)
CritiqueLLM: Towards an Informative Critique Generation Model for Evaluation of Large Language Model Generation
di: Ke, Pei, et al.
Pubblicazione: (2023)
di: Ke, Pei, et al.
Pubblicazione: (2023)
HoWToBench: Holistic Evaluation for LLM's Capability in Human-level Writing using Tree of Writing
di: Feng, Andrew Zhuoer, et al.
Pubblicazione: (2026)
di: Feng, Andrew Zhuoer, et al.
Pubblicazione: (2026)
Neural Task Synthesis for Visual Programming
di: Pădurean, Victor-Alexandru, et al.
Pubblicazione: (2023)
di: Pădurean, Victor-Alexandru, et al.
Pubblicazione: (2023)
ChatGLM-RLHF: Practices of Aligning Large Language Models with Human Feedback
di: Hou, Zhenyu, et al.
Pubblicazione: (2024)
di: Hou, Zhenyu, et al.
Pubblicazione: (2024)
QiMeng-Xpiler: Transcompiling Tensor Programs for Deep Learning Systems with a Neural-Symbolic Approach
di: Dong, Shouyang, et al.
Pubblicazione: (2025)
di: Dong, Shouyang, et al.
Pubblicazione: (2025)
CharacterBench: Benchmarking Character Customization of Large Language Models
di: Zhou, Jinfeng, et al.
Pubblicazione: (2024)
di: Zhou, Jinfeng, et al.
Pubblicazione: (2024)
When Smiley Turns Hostile: Interpreting How Emojis Trigger LLMs' Toxicity
di: Cui, Shiyao, et al.
Pubblicazione: (2025)
di: Cui, Shiyao, et al.
Pubblicazione: (2025)
Compile to Compress: Boosting Formal Theorem Provers by Compiler Outputs
di: Li, Guchan, et al.
Pubblicazione: (2026)
di: Li, Guchan, et al.
Pubblicazione: (2026)
Quokka: Accelerating Program Verification with LLMs via Invariant Synthesis
di: Wei, Anjiang, et al.
Pubblicazione: (2025)
di: Wei, Anjiang, et al.
Pubblicazione: (2025)
The Superalignment of Superhuman Intelligence with Large Language Models
di: Huang, Minlie, et al.
Pubblicazione: (2024)
di: Huang, Minlie, et al.
Pubblicazione: (2024)
C Analyzer : A Static Program Analysis Tool for C Programs
di: Solanki, Rajendra Kumar
Pubblicazione: (2024)
di: Solanki, Rajendra Kumar
Pubblicazione: (2024)
SocialSim: Towards Socialized Simulation of Emotional Support Conversation
di: Chen, Zhuang, et al.
Pubblicazione: (2025)
di: Chen, Zhuang, et al.
Pubblicazione: (2025)
Perception of Knowledge Boundary for Large Language Models through Semi-open-ended Question Answering
di: Wen, Zhihua, et al.
Pubblicazione: (2024)
di: Wen, Zhihua, et al.
Pubblicazione: (2024)
Hear Your Code Fail, Voice-Assisted Debugging for Python
di: Amiri, Sayed Mahbub Hasan, et al.
Pubblicazione: (2025)
di: Amiri, Sayed Mahbub Hasan, et al.
Pubblicazione: (2025)
AutoPRM: Automating Procedural Supervision for Multi-Step Reasoning via Controllable Question Decomposition
di: Chen, Zhaorun, et al.
Pubblicazione: (2024)
di: Chen, Zhaorun, et al.
Pubblicazione: (2024)
Constrained Code Generation with Discrete Diffusion
di: Shao, Lize, et al.
Pubblicazione: (2026)
di: Shao, Lize, et al.
Pubblicazione: (2026)
Bridging the Knowledge Void: Inference-time Acquisition of Unfamiliar Programming Languages for Coding Tasks
di: Shen, Chen, et al.
Pubblicazione: (2026)
di: Shen, Chen, et al.
Pubblicazione: (2026)
RAVEL: Reasoning Agents for Validating and Evaluating LLM Text Synthesis
di: Feng, Andrew Zhuoer, et al.
Pubblicazione: (2026)
di: Feng, Andrew Zhuoer, et al.
Pubblicazione: (2026)
ShieldVLM: Safeguarding the Multimodal Implicit Toxicity via Deliberative Reasoning with LVLMs
di: Cui, Shiyao, et al.
Pubblicazione: (2025)
di: Cui, Shiyao, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Language Model Decoding as Direct Metrics Optimization
di: Ji, Haozhe, et al.
Pubblicazione: (2023) -
Unlocking Reasoning Potential in Large Langauge Models by Scaling Code-form Planning
di: Wen, Jiaxin, et al.
Pubblicazione: (2024) -
Defending Large Language Models Against Jailbreaking Attacks Through Goal Prioritization
di: Zhang, Zhexin, et al.
Pubblicazione: (2023) -
Language Models Learn to Mislead Humans via RLHF
di: Wen, Jiaxin, et al.
Pubblicazione: (2024) -
IF-RewardBench: Benchmarking Judge Models for Instruction-Following Evaluation
di: Wen, Bosi, et al.
Pubblicazione: (2026)