Jailbreak Scaling Laws for Large Language Models: Polynomial-Exponential Crossover
Fuente:
arXiv
Guardado en:
| Autores principales: | Halder, Indranil, Banerjee, Annesya, Pehlevan, Cengiz |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Demystifying LLM-as-a-Judge: Analytically Tractable Model for Inference-Time Scaling
por: Halder, Indranil, et al.
Publicado: (2025)
por: Halder, Indranil, et al.
Publicado: (2025)
Universal One-third Time Scaling in Learning Peaked Distributions
por: Liu, Yizhou, et al.
Publicado: (2026)
por: Liu, Yizhou, et al.
Publicado: (2026)
Error Broadcast and Decorrelation as a Potential Artificial and Natural Learning Mechanism
por: Erdogan, Mete, et al.
Publicado: (2025)
por: Erdogan, Mete, et al.
Publicado: (2025)
Score Broadcast and Decorrelation: A General Framework for Broadcast-Based Credit Assignment
por: Uzun, Mustafa, et al.
Publicado: (2026)
por: Uzun, Mustafa, et al.
Publicado: (2026)
Spectral Dynamics in Deep Networks: Feature Learning, Outlier Escape, and Learning Rate Transfer
por: Lauditi, Clarissa, et al.
Publicado: (2026)
por: Lauditi, Clarissa, et al.
Publicado: (2026)
Boule or Baguette? A Study on Task Topology, Length Generalization, and the Benefit of Reasoning Traces
por: Tong, William L., et al.
Publicado: (2026)
por: Tong, William L., et al.
Publicado: (2026)
A Dynamical Model of Neural Scaling Laws
por: Bordelon, Blake, et al.
Publicado: (2024)
por: Bordelon, Blake, et al.
Publicado: (2024)
Pixel-Based Similarities as an Alternative to Neural Data for Improving Convolutional Neural Network Adversarial Robustness
por: Attias, Elie, et al.
Publicado: (2024)
por: Attias, Elie, et al.
Publicado: (2024)
Anytime Pretraining: Horizon-Free Learning-Rate Schedules with Weight Averaging
por: Meterez, Alexandru, et al.
Publicado: (2026)
por: Meterez, Alexandru, et al.
Publicado: (2026)
Jailbreaking Black Box Large Language Models in Twenty Queries
por: Chao, Patrick, et al.
Publicado: (2023)
por: Chao, Patrick, et al.
Publicado: (2023)
Generalizing Scaling Laws for Dense and Sparse Large Language Models
por: Hossain, Md Arafat, et al.
Publicado: (2025)
por: Hossain, Md Arafat, et al.
Publicado: (2025)
How Feature Learning Can Improve Neural Scaling Laws
por: Bordelon, Blake, et al.
Publicado: (2024)
por: Bordelon, Blake, et al.
Publicado: (2024)
BiasJailbreak:Analyzing Ethical Biases and Jailbreak Vulnerabilities in Large Language Models
por: Lee, Isack, et al.
Publicado: (2024)
por: Lee, Isack, et al.
Publicado: (2024)
SmoothLLM: Defending Large Language Models Against Jailbreaking Attacks
por: Robey, Alexander, et al.
Publicado: (2023)
por: Robey, Alexander, et al.
Publicado: (2023)
Jailbreaking and Mitigation of Vulnerabilities in Large Language Models
por: Peng, Benji, et al.
Publicado: (2024)
por: Peng, Benji, et al.
Publicado: (2024)
Seesaw: Accelerating Training by Balancing Learning Rate and Batch Size Scheduling
por: Meterez, Alexandru, et al.
Publicado: (2025)
por: Meterez, Alexandru, et al.
Publicado: (2025)
The Laminar Flow Hypothesis: Detecting Jailbreaks via Semantic Turbulence in Large Language Models
por: Rahman, Md. Hasib Ur
Publicado: (2025)
por: Rahman, Md. Hasib Ur
Publicado: (2025)
Uncovering Scaling Laws for Large Language Models via Inverse Problems
por: Verma, Arun, et al.
Publicado: (2025)
por: Verma, Arun, et al.
Publicado: (2025)
Provable Scaling Laws for the Test-Time Compute of Large Language Models
por: Chen, Yanxi, et al.
Publicado: (2024)
por: Chen, Yanxi, et al.
Publicado: (2024)
Scaling Laws Across Model Architectures: A Comparative Analysis of Dense and MoE Models in Large Language Models
por: Wang, Siqi, et al.
Publicado: (2024)
por: Wang, Siqi, et al.
Publicado: (2024)
Theory of Scaling Laws for In-Context Regression: Depth, Width, Context and Time
por: Bordelon, Blake, et al.
Publicado: (2025)
por: Bordelon, Blake, et al.
Publicado: (2025)
The Law of Multi-Model Collaboration: Scaling Limits of Model Ensembling for Large Language Models
por: Lu, Dakuan, et al.
Publicado: (2025)
por: Lu, Dakuan, et al.
Publicado: (2025)
Single-pass Detection of Jailbreaking Input in Large Language Models
por: Candogan, Leyla Naz, et al.
Publicado: (2025)
por: Candogan, Leyla Naz, et al.
Publicado: (2025)
TROJail: Trajectory-Level Optimization for Multi-Turn Large Language Model Jailbreaks with Process Rewards
por: Xiong, Xiqiao, et al.
Publicado: (2025)
por: Xiong, Xiqiao, et al.
Publicado: (2025)
Predictable Scale: Part II, Farseer: A Refined Scaling Law in Large Language Models
por: Li, Houyi, et al.
Publicado: (2025)
por: Li, Houyi, et al.
Publicado: (2025)
Wukong: Towards a Scaling Law for Large-Scale Recommendation
por: Zhang, Buyun, et al.
Publicado: (2024)
por: Zhang, Buyun, et al.
Publicado: (2024)
Selecting Large Language Model to Fine-tune via Rectified Scaling Law
por: Lin, Haowei, et al.
Publicado: (2024)
por: Lin, Haowei, et al.
Publicado: (2024)
Jailbreaking Large Language Models with Symbolic Mathematics
por: Bethany, Emet, et al.
Publicado: (2024)
por: Bethany, Emet, et al.
Publicado: (2024)
Don't be lazy: CompleteP enables compute-efficient deep transformers
por: Dey, Nolan, et al.
Publicado: (2025)
por: Dey, Nolan, et al.
Publicado: (2025)
Improved Large Language Model Jailbreak Detection via Pretrained Embeddings
por: Galinkin, Erick, et al.
Publicado: (2024)
por: Galinkin, Erick, et al.
Publicado: (2024)
Can Language Models Discover Scaling Laws?
por: Lin, Haowei, et al.
Publicado: (2025)
por: Lin, Haowei, et al.
Publicado: (2025)
A Random Matrix Theory Perspective on the Consistency of Diffusion Models
por: Wang, Binxu, et al.
Publicado: (2026)
por: Wang, Binxu, et al.
Publicado: (2026)
Task-Stratified Knowledge Scaling Laws for Post-Training Quantized Large Language Models
por: Zhou, Chenxi, et al.
Publicado: (2025)
por: Zhou, Chenxi, et al.
Publicado: (2025)
A Hierarchical Language Model with Predictable Scaling Laws and Provable Benefits of Reasoning
por: Gaitonde, Jason, et al.
Publicado: (2026)
por: Gaitonde, Jason, et al.
Publicado: (2026)
Spectra 1.1: Scaling Laws and Efficient Inference for Ternary Language Models
por: Vaidhya, Tejas, et al.
Publicado: (2025)
por: Vaidhya, Tejas, et al.
Publicado: (2025)
Scaling Law Hypothesis for Multimodal Model
por: Sun, Qingyun, et al.
Publicado: (2024)
por: Sun, Qingyun, et al.
Publicado: (2024)
EnJa: Ensemble Jailbreak on Large Language Models
por: Zhang, Jiahao, et al.
Publicado: (2024)
por: Zhang, Jiahao, et al.
Publicado: (2024)
LatentBreak: Jailbreaking Large Language Models through Latent Space Feedback
por: Mura, Raffaele, et al.
Publicado: (2025)
por: Mura, Raffaele, et al.
Publicado: (2025)
Skywork-Math: Data Scaling Laws for Mathematical Reasoning in Large Language Models -- The Story Goes On
por: Zeng, Liang, et al.
Publicado: (2024)
por: Zeng, Liang, et al.
Publicado: (2024)
Parameters vs FLOPs: Scaling Laws for Optimal Sparsity for Mixture-of-Experts Language Models
por: Abnar, Samira, et al.
Publicado: (2025)
por: Abnar, Samira, et al.
Publicado: (2025)
Ejemplares similares
-
Demystifying LLM-as-a-Judge: Analytically Tractable Model for Inference-Time Scaling
por: Halder, Indranil, et al.
Publicado: (2025) -
Universal One-third Time Scaling in Learning Peaked Distributions
por: Liu, Yizhou, et al.
Publicado: (2026) -
Error Broadcast and Decorrelation as a Potential Artificial and Natural Learning Mechanism
por: Erdogan, Mete, et al.
Publicado: (2025) -
Score Broadcast and Decorrelation: A General Framework for Broadcast-Based Credit Assignment
por: Uzun, Mustafa, et al.
Publicado: (2026) -
Spectral Dynamics in Deep Networks: Feature Learning, Outlier Escape, and Learning Rate Transfer
por: Lauditi, Clarissa, et al.
Publicado: (2026)