Libra: Large Chinese-based Safeguard for AI Content
Fuente:
arXiv
Salvato in:
| Autori principali: | Chen, Ziyang, Yu, Huimu, Wu, Xing, Liu, Dongqin, Hu, Songlin |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
CodePMP: Scalable Preference Model Pretraining for Large Language Model Reasoning
di: Yu, Huimu, et al.
Pubblicazione: (2024)
di: Yu, Huimu, et al.
Pubblicazione: (2024)
Agent Tools Orchestration Leaks More: Dataset, Benchmark, and Mitigation
di: Qiao, Yuxuan, et al.
Pubblicazione: (2025)
di: Qiao, Yuxuan, et al.
Pubblicazione: (2025)
A Simple and Effective Framework for Symmetric Consistent Indexing in Large-Scale Dense Retrieval
di: Wang, Huimu, et al.
Pubblicazione: (2025)
di: Wang, Huimu, et al.
Pubblicazione: (2025)
Quest: Query-centric Data Synthesis Approach for Long-context Scaling of Large Language Model
di: Gao, Chaochen, et al.
Pubblicazione: (2024)
di: Gao, Chaochen, et al.
Pubblicazione: (2024)
A Preference-oriented Diversity Model Based on Mutual-information in Re-ranking for E-commerce Search
di: Wang, Huimu, et al.
Pubblicazione: (2024)
di: Wang, Huimu, et al.
Pubblicazione: (2024)
PolicyLong: Towards On-Policy Context Extension
di: Jia, Junlong, et al.
Pubblicazione: (2026)
di: Jia, Junlong, et al.
Pubblicazione: (2026)
LongBench Pro: A More Realistic and Comprehensive Bilingual Long-Context Evaluation Benchmark
di: Chen, Ziyang, et al.
Pubblicazione: (2026)
di: Chen, Ziyang, et al.
Pubblicazione: (2026)
LongMagpie: A Self-synthesis Method for Generating Large-scale Long-context Instructions
di: Gao, Chaochen, et al.
Pubblicazione: (2025)
di: Gao, Chaochen, et al.
Pubblicazione: (2025)
AdaShield: Safeguarding Multimodal Large Language Models from Structure-based Attack via Adaptive Shield Prompting
di: Wang, Yu, et al.
Pubblicazione: (2024)
di: Wang, Yu, et al.
Pubblicazione: (2024)
Dial-MAE: ConTextual Masked Auto-Encoder for Retrieval-based Dialogue Systems
di: Su, Zhenpeng, et al.
Pubblicazione: (2023)
di: Su, Zhenpeng, et al.
Pubblicazione: (2023)
EntropyLong: Effective Long-Context Training via Predictive Uncertainty
di: Jia, Junlong, et al.
Pubblicazione: (2025)
di: Jia, Junlong, et al.
Pubblicazione: (2025)
Safeguarding Large Language Models: A Survey
di: Dong, Yi, et al.
Pubblicazione: (2024)
di: Dong, Yi, et al.
Pubblicazione: (2024)
Dynamic Guided and Domain Applicable Safeguards for Enhanced Security in Large Language Models
di: Luo, Weidi, et al.
Pubblicazione: (2024)
di: Luo, Weidi, et al.
Pubblicazione: (2024)
LLM Safeguard is a Double-Edged Sword: Exploiting False Positives for Denial-of-Service Attacks
di: Zhang, Qingzhao, et al.
Pubblicazione: (2024)
di: Zhang, Qingzhao, et al.
Pubblicazione: (2024)
Chinese Tiny LLM: Pretraining a Chinese-Centric Large Language Model
di: Du, Xinrun, et al.
Pubblicazione: (2024)
di: Du, Xinrun, et al.
Pubblicazione: (2024)
AgentSafe: Safeguarding Large Language Model-based Multi-agent Systems via Hierarchical Data Management
di: Mao, Junyuan, et al.
Pubblicazione: (2025)
di: Mao, Junyuan, et al.
Pubblicazione: (2025)
Safeguarding Federated Learning-based Road Condition Classification
di: Liu, Sheng, et al.
Pubblicazione: (2025)
di: Liu, Sheng, et al.
Pubblicazione: (2025)
NExtLong: Toward Effective Long-Context Training without Long Documents
di: Gao, Chaochen, et al.
Pubblicazione: (2025)
di: Gao, Chaochen, et al.
Pubblicazione: (2025)
HC3 Plus: A Semantic-Invariant Human ChatGPT Comparison Corpus
di: Su, Zhenpeng, et al.
Pubblicazione: (2023)
di: Su, Zhenpeng, et al.
Pubblicazione: (2023)
GuardReasoner: Towards Reasoning-based LLM Safeguards
di: Liu, Yue, et al.
Pubblicazione: (2025)
di: Liu, Yue, et al.
Pubblicazione: (2025)
Kelp: A Streaming Safeguard for Large Models via Latent Dynamics-Guided Risk Detection
di: Li, Xiaodan, et al.
Pubblicazione: (2025)
di: Li, Xiaodan, et al.
Pubblicazione: (2025)
Safeguarding AI Agents: Developing and Analyzing Safety Architectures
di: Domkundwar, Ishaan, et al.
Pubblicazione: (2024)
di: Domkundwar, Ishaan, et al.
Pubblicazione: (2024)
Group Selection as a Safeguard Against AI Substitution
di: Zhong, Qiankun, et al.
Pubblicazione: (2026)
di: Zhong, Qiankun, et al.
Pubblicazione: (2026)
AI Content Self-Detection for Transformer-based Large Language Models
di: Caiado, Antônio Junior Alves, et al.
Pubblicazione: (2023)
di: Caiado, Antônio Junior Alves, et al.
Pubblicazione: (2023)
Embedding with Large Language Models for Classification of HIPAA Safeguard Compliance Rules
di: Rahman, Md Abdur, et al.
Pubblicazione: (2024)
di: Rahman, Md Abdur, et al.
Pubblicazione: (2024)
BlindGuard: Safeguarding LLM-based Multi-Agent Systems under Unknown Attacks
di: Miao, Rui, et al.
Pubblicazione: (2025)
di: Miao, Rui, et al.
Pubblicazione: (2025)
Shattering the Echo Chamber: Hidden Safeguards in Manuscripts Against the AI Takeover of Peer Review
di: Ma, Oubo, et al.
Pubblicazione: (2026)
di: Ma, Oubo, et al.
Pubblicazione: (2026)
On Prompt-Driven Safeguarding for Large Language Models
di: Zheng, Chujie, et al.
Pubblicazione: (2024)
di: Zheng, Chujie, et al.
Pubblicazione: (2024)
ClaimGen-CN: A Large-scale Chinese Dataset for Legal Claim Generation
di: Zhou, Siying, et al.
Pubblicazione: (2025)
di: Zhou, Siying, et al.
Pubblicazione: (2025)
AI Scientist via Synthetic Task Scaling
di: Cai, Ziyang, et al.
Pubblicazione: (2026)
di: Cai, Ziyang, et al.
Pubblicazione: (2026)
Mastering Chinese Chess AI (Xiangqi) Without Search
di: Chen, Yu, et al.
Pubblicazione: (2024)
di: Chen, Yu, et al.
Pubblicazione: (2024)
Breaking the Hourglass Phenomenon of Residual Quantization: Enhancing the Upper Bound of Generative Retrieval
di: Kuai, Zhirui, et al.
Pubblicazione: (2024)
di: Kuai, Zhirui, et al.
Pubblicazione: (2024)
Stochastic Trajectory Prediction under Unstructured Constraints
di: Ma, Hao, et al.
Pubblicazione: (2025)
di: Ma, Hao, et al.
Pubblicazione: (2025)
HFuzzer: Testing Large Language Models for Package Hallucinations via Phrase-based Fuzzing
di: Zhao, Yukai, et al.
Pubblicazione: (2025)
di: Zhao, Yukai, et al.
Pubblicazione: (2025)
Safeguarding Marketing Research: The Generation, Identification, and Mitigation of AI-Fabricated Disinformation
di: Mukherjee, Anirban
Pubblicazione: (2024)
di: Mukherjee, Anirban
Pubblicazione: (2024)
An AI Agent Execution Environment to Safeguard User Data
di: Stanley, Robert, et al.
Pubblicazione: (2026)
di: Stanley, Robert, et al.
Pubblicazione: (2026)
SeqUDA-Rec: Sequential User Behavior Enhanced Recommendation via Global Unsupervised Data Augmentation for Personalized Content Marketing
di: Luo, Ruihan, et al.
Pubblicazione: (2025)
di: Luo, Ruihan, et al.
Pubblicazione: (2025)
Measuring Human Contribution in AI-Assisted Content Generation
di: Xie, Yueqi, et al.
Pubblicazione: (2024)
di: Xie, Yueqi, et al.
Pubblicazione: (2024)
R3A: Reinforced Reasoning for Relevance Assessment for RAG in User-Generated Content Platforms
di: Yuan, Xiaowei, et al.
Pubblicazione: (2025)
di: Yuan, Xiaowei, et al.
Pubblicazione: (2025)
SABER: Small Actions, Big Errors -- Safeguarding Mutating Steps in LLM Agents
di: Cuadron, Alejandro, et al.
Pubblicazione: (2025)
di: Cuadron, Alejandro, et al.
Pubblicazione: (2025)
Documenti analoghi
-
CodePMP: Scalable Preference Model Pretraining for Large Language Model Reasoning
di: Yu, Huimu, et al.
Pubblicazione: (2024) -
Agent Tools Orchestration Leaks More: Dataset, Benchmark, and Mitigation
di: Qiao, Yuxuan, et al.
Pubblicazione: (2025) -
A Simple and Effective Framework for Symmetric Consistent Indexing in Large-Scale Dense Retrieval
di: Wang, Huimu, et al.
Pubblicazione: (2025) -
Quest: Query-centric Data Synthesis Approach for Long-context Scaling of Large Language Model
di: Gao, Chaochen, et al.
Pubblicazione: (2024) -
A Preference-oriented Diversity Model Based on Mutual-information in Re-ranking for E-commerce Search
di: Wang, Huimu, et al.
Pubblicazione: (2024)