Libra: Large Chinese-based Safeguard for AI Content
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Chen, Ziyang, Yu, Huimu, Wu, Xing, Liu, Dongqin, Hu, Songlin |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
CodePMP: Scalable Preference Model Pretraining for Large Language Model Reasoning
par: Yu, Huimu, et autres
Publié: (2024)
par: Yu, Huimu, et autres
Publié: (2024)
Agent Tools Orchestration Leaks More: Dataset, Benchmark, and Mitigation
par: Qiao, Yuxuan, et autres
Publié: (2025)
par: Qiao, Yuxuan, et autres
Publié: (2025)
A Simple and Effective Framework for Symmetric Consistent Indexing in Large-Scale Dense Retrieval
par: Wang, Huimu, et autres
Publié: (2025)
par: Wang, Huimu, et autres
Publié: (2025)
Quest: Query-centric Data Synthesis Approach for Long-context Scaling of Large Language Model
par: Gao, Chaochen, et autres
Publié: (2024)
par: Gao, Chaochen, et autres
Publié: (2024)
A Preference-oriented Diversity Model Based on Mutual-information in Re-ranking for E-commerce Search
par: Wang, Huimu, et autres
Publié: (2024)
par: Wang, Huimu, et autres
Publié: (2024)
PolicyLong: Towards On-Policy Context Extension
par: Jia, Junlong, et autres
Publié: (2026)
par: Jia, Junlong, et autres
Publié: (2026)
LongBench Pro: A More Realistic and Comprehensive Bilingual Long-Context Evaluation Benchmark
par: Chen, Ziyang, et autres
Publié: (2026)
par: Chen, Ziyang, et autres
Publié: (2026)
LongMagpie: A Self-synthesis Method for Generating Large-scale Long-context Instructions
par: Gao, Chaochen, et autres
Publié: (2025)
par: Gao, Chaochen, et autres
Publié: (2025)
AdaShield: Safeguarding Multimodal Large Language Models from Structure-based Attack via Adaptive Shield Prompting
par: Wang, Yu, et autres
Publié: (2024)
par: Wang, Yu, et autres
Publié: (2024)
Dial-MAE: ConTextual Masked Auto-Encoder for Retrieval-based Dialogue Systems
par: Su, Zhenpeng, et autres
Publié: (2023)
par: Su, Zhenpeng, et autres
Publié: (2023)
EntropyLong: Effective Long-Context Training via Predictive Uncertainty
par: Jia, Junlong, et autres
Publié: (2025)
par: Jia, Junlong, et autres
Publié: (2025)
Safeguarding Large Language Models: A Survey
par: Dong, Yi, et autres
Publié: (2024)
par: Dong, Yi, et autres
Publié: (2024)
Dynamic Guided and Domain Applicable Safeguards for Enhanced Security in Large Language Models
par: Luo, Weidi, et autres
Publié: (2024)
par: Luo, Weidi, et autres
Publié: (2024)
LLM Safeguard is a Double-Edged Sword: Exploiting False Positives for Denial-of-Service Attacks
par: Zhang, Qingzhao, et autres
Publié: (2024)
par: Zhang, Qingzhao, et autres
Publié: (2024)
Chinese Tiny LLM: Pretraining a Chinese-Centric Large Language Model
par: Du, Xinrun, et autres
Publié: (2024)
par: Du, Xinrun, et autres
Publié: (2024)
AgentSafe: Safeguarding Large Language Model-based Multi-agent Systems via Hierarchical Data Management
par: Mao, Junyuan, et autres
Publié: (2025)
par: Mao, Junyuan, et autres
Publié: (2025)
Safeguarding Federated Learning-based Road Condition Classification
par: Liu, Sheng, et autres
Publié: (2025)
par: Liu, Sheng, et autres
Publié: (2025)
NExtLong: Toward Effective Long-Context Training without Long Documents
par: Gao, Chaochen, et autres
Publié: (2025)
par: Gao, Chaochen, et autres
Publié: (2025)
HC3 Plus: A Semantic-Invariant Human ChatGPT Comparison Corpus
par: Su, Zhenpeng, et autres
Publié: (2023)
par: Su, Zhenpeng, et autres
Publié: (2023)
GuardReasoner: Towards Reasoning-based LLM Safeguards
par: Liu, Yue, et autres
Publié: (2025)
par: Liu, Yue, et autres
Publié: (2025)
Kelp: A Streaming Safeguard for Large Models via Latent Dynamics-Guided Risk Detection
par: Li, Xiaodan, et autres
Publié: (2025)
par: Li, Xiaodan, et autres
Publié: (2025)
Safeguarding AI Agents: Developing and Analyzing Safety Architectures
par: Domkundwar, Ishaan, et autres
Publié: (2024)
par: Domkundwar, Ishaan, et autres
Publié: (2024)
Group Selection as a Safeguard Against AI Substitution
par: Zhong, Qiankun, et autres
Publié: (2026)
par: Zhong, Qiankun, et autres
Publié: (2026)
AI Content Self-Detection for Transformer-based Large Language Models
par: Caiado, Antônio Junior Alves, et autres
Publié: (2023)
par: Caiado, Antônio Junior Alves, et autres
Publié: (2023)
Embedding with Large Language Models for Classification of HIPAA Safeguard Compliance Rules
par: Rahman, Md Abdur, et autres
Publié: (2024)
par: Rahman, Md Abdur, et autres
Publié: (2024)
BlindGuard: Safeguarding LLM-based Multi-Agent Systems under Unknown Attacks
par: Miao, Rui, et autres
Publié: (2025)
par: Miao, Rui, et autres
Publié: (2025)
Shattering the Echo Chamber: Hidden Safeguards in Manuscripts Against the AI Takeover of Peer Review
par: Ma, Oubo, et autres
Publié: (2026)
par: Ma, Oubo, et autres
Publié: (2026)
On Prompt-Driven Safeguarding for Large Language Models
par: Zheng, Chujie, et autres
Publié: (2024)
par: Zheng, Chujie, et autres
Publié: (2024)
ClaimGen-CN: A Large-scale Chinese Dataset for Legal Claim Generation
par: Zhou, Siying, et autres
Publié: (2025)
par: Zhou, Siying, et autres
Publié: (2025)
AI Scientist via Synthetic Task Scaling
par: Cai, Ziyang, et autres
Publié: (2026)
par: Cai, Ziyang, et autres
Publié: (2026)
Mastering Chinese Chess AI (Xiangqi) Without Search
par: Chen, Yu, et autres
Publié: (2024)
par: Chen, Yu, et autres
Publié: (2024)
Breaking the Hourglass Phenomenon of Residual Quantization: Enhancing the Upper Bound of Generative Retrieval
par: Kuai, Zhirui, et autres
Publié: (2024)
par: Kuai, Zhirui, et autres
Publié: (2024)
Stochastic Trajectory Prediction under Unstructured Constraints
par: Ma, Hao, et autres
Publié: (2025)
par: Ma, Hao, et autres
Publié: (2025)
HFuzzer: Testing Large Language Models for Package Hallucinations via Phrase-based Fuzzing
par: Zhao, Yukai, et autres
Publié: (2025)
par: Zhao, Yukai, et autres
Publié: (2025)
Safeguarding Marketing Research: The Generation, Identification, and Mitigation of AI-Fabricated Disinformation
par: Mukherjee, Anirban
Publié: (2024)
par: Mukherjee, Anirban
Publié: (2024)
An AI Agent Execution Environment to Safeguard User Data
par: Stanley, Robert, et autres
Publié: (2026)
par: Stanley, Robert, et autres
Publié: (2026)
SeqUDA-Rec: Sequential User Behavior Enhanced Recommendation via Global Unsupervised Data Augmentation for Personalized Content Marketing
par: Luo, Ruihan, et autres
Publié: (2025)
par: Luo, Ruihan, et autres
Publié: (2025)
Measuring Human Contribution in AI-Assisted Content Generation
par: Xie, Yueqi, et autres
Publié: (2024)
par: Xie, Yueqi, et autres
Publié: (2024)
R3A: Reinforced Reasoning for Relevance Assessment for RAG in User-Generated Content Platforms
par: Yuan, Xiaowei, et autres
Publié: (2025)
par: Yuan, Xiaowei, et autres
Publié: (2025)
SABER: Small Actions, Big Errors -- Safeguarding Mutating Steps in LLM Agents
par: Cuadron, Alejandro, et autres
Publié: (2025)
par: Cuadron, Alejandro, et autres
Publié: (2025)
Documents similaires
-
CodePMP: Scalable Preference Model Pretraining for Large Language Model Reasoning
par: Yu, Huimu, et autres
Publié: (2024) -
Agent Tools Orchestration Leaks More: Dataset, Benchmark, and Mitigation
par: Qiao, Yuxuan, et autres
Publié: (2025) -
A Simple and Effective Framework for Symmetric Consistent Indexing in Large-Scale Dense Retrieval
par: Wang, Huimu, et autres
Publié: (2025) -
Quest: Query-centric Data Synthesis Approach for Long-context Scaling of Large Language Model
par: Gao, Chaochen, et autres
Publié: (2024) -
A Preference-oriented Diversity Model Based on Mutual-information in Re-ranking for E-commerce Search
par: Wang, Huimu, et autres
Publié: (2024)