NJUST-KMG at TRAC-2024 Tasks 1 and 2: Offline Harm Potential Identification
Fuente:
arXiv
Salvato in:
| Autori principali: | Wang, Jingyuan, Xu, Shengdong, Yang, Yang |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
LegalLens Shared Task 2024: Legal Violation Identification in Unstructured Text
di: Hagag, Ben, et al.
Pubblicazione: (2024)
di: Hagag, Ben, et al.
Pubblicazione: (2024)
Investigating and Alleviating Harm Amplification in LLM Interactions
di: Guo, Ruohao, et al.
Pubblicazione: (2026)
di: Guo, Ruohao, et al.
Pubblicazione: (2026)
MULTISCRIPT: Multimodal Script Learning for Supporting Open Domain Everyday Tasks
di: Qi, Jingyuan, et al.
Pubblicazione: (2023)
di: Qi, Jingyuan, et al.
Pubblicazione: (2023)
Data Contamination Report from the 2024 CONDA Shared Task
di: Sainz, Oscar, et al.
Pubblicazione: (2024)
di: Sainz, Oscar, et al.
Pubblicazione: (2024)
From Representational Harms to Quality-of-Service Harms: A Case Study on Llama 2 Safety Safeguards
di: Chehbouni, Khaoula, et al.
Pubblicazione: (2024)
di: Chehbouni, Khaoula, et al.
Pubblicazione: (2024)
AgentHarm: A Benchmark for Measuring Harmfulness of LLM Agents
di: Andriushchenko, Maksym, et al.
Pubblicazione: (2024)
di: Andriushchenko, Maksym, et al.
Pubblicazione: (2024)
Task Vector Geometry Underlies Dual Modes of Task Inference in Transformers
di: Yan, Hao, et al.
Pubblicazione: (2026)
di: Yan, Hao, et al.
Pubblicazione: (2026)
Energy-Based Preference Model Offers Better Offline Alignment than the Bradley-Terry Preference Model
di: Hong, Yuzhong, et al.
Pubblicazione: (2024)
di: Hong, Yuzhong, et al.
Pubblicazione: (2024)
Offline Reinforcement Learning for LLM Multi-Step Reasoning
di: Wang, Huaijie, et al.
Pubblicazione: (2024)
di: Wang, Huaijie, et al.
Pubblicazione: (2024)
Opir: Efficient Multi-Task Safety Classification for Toxicity, Jailbreaks, Hate Speech, and Harmful Content
di: Stepanov, Ihor, et al.
Pubblicazione: (2026)
di: Stepanov, Ihor, et al.
Pubblicazione: (2026)
The Solution for The PST-KDD-2024 OAG-Challenge
di: Zhong, Shupeng, et al.
Pubblicazione: (2024)
di: Zhong, Shupeng, et al.
Pubblicazione: (2024)
SocialHarmBench: Revealing LLM Vulnerabilities to Socially Harmful Requests
di: Pandey, Punya Syon, et al.
Pubblicazione: (2025)
di: Pandey, Punya Syon, et al.
Pubblicazione: (2025)
Exploring Task Performance with Interpretable Models via Sparse Auto-Encoders
di: Wang, Shun, et al.
Pubblicazione: (2025)
di: Wang, Shun, et al.
Pubblicazione: (2025)
Token Buncher: Shielding LLMs from Harmful Reinforcement Learning Fine-Tuning
di: Feng, Weitao, et al.
Pubblicazione: (2025)
di: Feng, Weitao, et al.
Pubblicazione: (2025)
When 2D Tasks Meet 1D Serialization: On Serialization Friction in Structured Tasks
di: Lo, Chung-Hsiang, et al.
Pubblicazione: (2026)
di: Lo, Chung-Hsiang, et al.
Pubblicazione: (2026)
Representation Noising: A Defence Mechanism Against Harmful Finetuning
di: Rosati, Domenic, et al.
Pubblicazione: (2024)
di: Rosati, Domenic, et al.
Pubblicazione: (2024)
Disentangling Task Conflicts in Multi-Task LoRA via Orthogonal Gradient Projection
di: Yang, Ziyu, et al.
Pubblicazione: (2026)
di: Yang, Ziyu, et al.
Pubblicazione: (2026)
Knowledgeable Agents by Offline Reinforcement Learning from Large Language Model Rollouts
di: Pang, Jing-Cheng, et al.
Pubblicazione: (2024)
di: Pang, Jing-Cheng, et al.
Pubblicazione: (2024)
OCEAN: Offline Chain-of-thought Evaluation and Alignment in Large Language Models
di: Wu, Junda, et al.
Pubblicazione: (2024)
di: Wu, Junda, et al.
Pubblicazione: (2024)
RE-TRAC: REcursive TRAjectory Compression for Deep Search Agents
di: Zhu, Jialiang, et al.
Pubblicazione: (2026)
di: Zhu, Jialiang, et al.
Pubblicazione: (2026)
DISA: Offline Importance Sampling for Distribution-Matching LLM-RL
di: Wang, Shaobo, et al.
Pubblicazione: (2026)
di: Wang, Shaobo, et al.
Pubblicazione: (2026)
NeuroLoRA: Context-Aware Neuromodulation for Parameter-Efficient Multi-Task Adaptation
di: Yang, Yuxin, et al.
Pubblicazione: (2026)
di: Yang, Yuxin, et al.
Pubblicazione: (2026)
A Baseline for Self-state Identification and Classification in Mental Health Data: CLPsych 2025 Task
di: Kim, Laerdon
Pubblicazione: (2025)
di: Kim, Laerdon
Pubblicazione: (2025)
Harder Tasks Need More Experts: Dynamic Routing in MoE Models
di: Huang, Quzhe, et al.
Pubblicazione: (2024)
di: Huang, Quzhe, et al.
Pubblicazione: (2024)
Learning Task Representations from In-Context Learning
di: Saglam, Baturay, et al.
Pubblicazione: (2025)
di: Saglam, Baturay, et al.
Pubblicazione: (2025)
HarmAug: Effective Data Augmentation for Knowledge Distillation of Safety Guard Models
di: Lee, Seanie, et al.
Pubblicazione: (2024)
di: Lee, Seanie, et al.
Pubblicazione: (2024)
Which LLMs are Difficult to Detect? A Detailed Analysis of Potential Factors Contributing to Difficulties in LLM Text Detection
di: Thorat, Shantanu, et al.
Pubblicazione: (2024)
di: Thorat, Shantanu, et al.
Pubblicazione: (2024)
PCL-Reasoner-V1.5: Advancing Math Reasoning with Offline Reinforcement Learning
di: Lu, Yao, et al.
Pubblicazione: (2026)
di: Lu, Yao, et al.
Pubblicazione: (2026)
Offline RL by Reward-Weighted Fine-Tuning for Conversation Optimization
di: Mukherjee, Subhojyoti, et al.
Pubblicazione: (2025)
di: Mukherjee, Subhojyoti, et al.
Pubblicazione: (2025)
Offline Preference Optimization via Maximum Marginal Likelihood Estimation
di: Najafi, Saeed, et al.
Pubblicazione: (2025)
di: Najafi, Saeed, et al.
Pubblicazione: (2025)
Towards Safer Pretraining: Analyzing and Filtering Harmful Content in Webscale datasets for Responsible LLMs
di: Mendu, Sai Krishna, et al.
Pubblicazione: (2025)
di: Mendu, Sai Krishna, et al.
Pubblicazione: (2025)
MALTO at SemEval-2024 Task 6: Leveraging Synthetic Data for LLM Hallucination Detection
di: Borra, Federico, et al.
Pubblicazione: (2024)
di: Borra, Federico, et al.
Pubblicazione: (2024)
Frustratingly Easy Task-aware Pruning for Large Language Models
di: Tian, Yuanhe, et al.
Pubblicazione: (2025)
di: Tian, Yuanhe, et al.
Pubblicazione: (2025)
PIE: Performance Interval Estimation for Free-Form Generation Tasks
di: Hsu, Chi-Yang, et al.
Pubblicazione: (2025)
di: Hsu, Chi-Yang, et al.
Pubblicazione: (2025)
SIG: Speaker Identification in Literature via Prompt-Based Generation
di: Su, Zhenlin, et al.
Pubblicazione: (2023)
di: Su, Zhenlin, et al.
Pubblicazione: (2023)
Offline Exploration-Aware Fine-Tuning for Long-Chain Mathematical Reasoning
di: Mu, Yongyu, et al.
Pubblicazione: (2026)
di: Mu, Yongyu, et al.
Pubblicazione: (2026)
FLARE: Task-agnostic embedding model evaluation through a normalization process
di: Jiang, Jingzhou, et al.
Pubblicazione: (2026)
di: Jiang, Jingzhou, et al.
Pubblicazione: (2026)
Vaccine: Perturbation-aware Alignment for Large Language Models against Harmful Fine-tuning Attack
di: Huang, Tiansheng, et al.
Pubblicazione: (2024)
di: Huang, Tiansheng, et al.
Pubblicazione: (2024)
HarmPot: An Annotation Framework for Evaluating Offline Harm Potential of Social Media Text
di: Kumar, Ritesh, et al.
Pubblicazione: (2024)
di: Kumar, Ritesh, et al.
Pubblicazione: (2024)
LLMLingua-2: Data Distillation for Efficient and Faithful Task-Agnostic Prompt Compression
di: Pan, Zhuoshi, et al.
Pubblicazione: (2024)
di: Pan, Zhuoshi, et al.
Pubblicazione: (2024)
Documenti analoghi
-
LegalLens Shared Task 2024: Legal Violation Identification in Unstructured Text
di: Hagag, Ben, et al.
Pubblicazione: (2024) -
Investigating and Alleviating Harm Amplification in LLM Interactions
di: Guo, Ruohao, et al.
Pubblicazione: (2026) -
MULTISCRIPT: Multimodal Script Learning for Supporting Open Domain Everyday Tasks
di: Qi, Jingyuan, et al.
Pubblicazione: (2023) -
Data Contamination Report from the 2024 CONDA Shared Task
di: Sainz, Oscar, et al.
Pubblicazione: (2024) -
From Representational Harms to Quality-of-Service Harms: A Case Study on Llama 2 Safety Safeguards
di: Chehbouni, Khaoula, et al.
Pubblicazione: (2024)