Peri-LN: Revisiting Normalization Layer in the Transformer Architecture
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Kim, Jeonghoon, Lee, Byeongchan, Park, Cheonbok, Oh, Yeontaek, Kim, Beomjun, Yoo, Taehwan, Shin, Seongjin, Han, Dongyoon, Shin, Jinwoo, Yoo, Kang Min |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
ReGUIDE: Data Efficient GUI Grounding via Spatial Reasoning and Search
par: Lee, Hyunseok, et autres
Publié: (2025)
par: Lee, Hyunseok, et autres
Publié: (2025)
Enhancing Hallucination Detection via Future Context
par: Lee, Joosung, et autres
Publié: (2025)
par: Lee, Joosung, et autres
Publié: (2025)
Cross-lingual Collapse: How Language-Centric Foundation Models Shape Reasoning in Large Language Models
par: Park, Cheonbok, et autres
Publié: (2025)
par: Park, Cheonbok, et autres
Publié: (2025)
CSA-Trans: Code Structure Aware Transformer for AST
par: Oh, Saeyoon, et autres
Publié: (2024)
par: Oh, Saeyoon, et autres
Publié: (2024)
Efficient LLM Collaboration via Planning
par: Lee, Byeongchan, et autres
Publié: (2025)
par: Lee, Byeongchan, et autres
Publié: (2025)
CLIP Meets Diffusion: A Synergistic Approach to Anomaly Detection
par: Lee, Byeongchan, et autres
Publié: (2025)
par: Lee, Byeongchan, et autres
Publié: (2025)
Code-Switching Curriculum Learning for Multilingual Transfer in LLMs
par: Yoo, Haneul, et autres
Publié: (2024)
par: Yoo, Haneul, et autres
Publié: (2024)
Aligning Language Models to Explicitly Handle Ambiguity
par: Kim, Hyuhng Joon, et autres
Publié: (2024)
par: Kim, Hyuhng Joon, et autres
Publié: (2024)
Multi-Step Likelihood-Ratio Correction for Reinforcement Learning with Verifiable Rewards
par: Yoon, Deokgyu, et autres
Publié: (2026)
par: Yoon, Deokgyu, et autres
Publié: (2026)
Revisiting "Revisiting Neuron Coverage for DNN Testing: A Layer-Wise and Distribution-Aware Criterion": A Critical Review and Implications on DNN Coverage Testing
par: Kim, Jinhan, et autres
Publié: (2026)
par: Kim, Jinhan, et autres
Publié: (2026)
Atropos: Improving Cost-Benefit Trade-off of LLM-based Agents under Self-Consistency with Early Termination and Model Hotswap
par: Kim, Naryeong, et autres
Publié: (2026)
par: Kim, Naryeong, et autres
Publié: (2026)
DANDI: Diffusion as Normative Distribution for Deep Neural Network Input
par: Kim, Somin, et autres
Publié: (2025)
par: Kim, Somin, et autres
Publié: (2025)
Latent Representation Alignment for Offline Goal-Conditioned Reinforcement Learning
par: Kang, Hyungkyu, et autres
Publié: (2026)
par: Kang, Hyungkyu, et autres
Publié: (2026)
Peng's Q($λ$) for Conservative Value Estimation in Offline Reinforcement Learning
par: Kim, Byeongchan, et autres
Publié: (2026)
par: Kim, Byeongchan, et autres
Publié: (2026)
Sommelier: Scalable Open Multi-turn Audio Pre-processing for Full-duplex Speech Language Models
par: Jung, Kyudan, et autres
Publié: (2026)
par: Jung, Kyudan, et autres
Publié: (2026)
SNAP: Speaker Nulling for Artifact Projection in Speech Deepfake Detection
par: Jung, Kyudan, et autres
Publié: (2026)
par: Jung, Kyudan, et autres
Publié: (2026)
Adaptive Contrastive Decoding in Retrieval-Augmented Generation for Handling Noisy Contexts
par: Kim, Youna, et autres
Publié: (2024)
par: Kim, Youna, et autres
Publié: (2024)
What Models Know, How Well They Know It: Knowledge-Weighted Fine-Tuning for Learning When to Say "I Don't Know"
par: Lee, Joosung, et autres
Publié: (2026)
par: Lee, Joosung, et autres
Publié: (2026)
Lachesis: Predicting LLM Inference Accuracy using Structural Properties of Reasoning Paths
par: Kim, Naryeong, et autres
Publié: (2024)
par: Kim, Naryeong, et autres
Publié: (2024)
ReflexiCoder: Teaching Large Language Models to Self-Reflect on Generated Code and Self-Correct It via Reinforcement Learning
par: Jiang, Juyong, et autres
Publié: (2026)
par: Jiang, Juyong, et autres
Publié: (2026)
Querying Easily Flip-flopped Samples for Deep Active Learning
par: Cho, Seong Jin, et autres
Publié: (2024)
par: Cho, Seong Jin, et autres
Publié: (2024)
On the Reliability of Cue Conflict and Beyond
par: Kim, Pum Jun, et autres
Publié: (2026)
par: Kim, Pum Jun, et autres
Publié: (2026)
On the Effect of Uncertainty on Layer-wise Inference Dynamics
par: Kim, Sunwoo, et autres
Publié: (2025)
par: Kim, Sunwoo, et autres
Publié: (2025)
KMMLU: Measuring Massive Multitask Language Understanding in Korean
par: Son, Guijin, et autres
Publié: (2024)
par: Son, Guijin, et autres
Publié: (2024)
PapersPlease: A Benchmark for Evaluating Motivational Values of Large Language Models Based on ERG Theory
par: Myung, Junho, et autres
Publié: (2025)
par: Myung, Junho, et autres
Publié: (2025)
Learning Point Cloud Geometry as a Statistical Manifold: Theory and Practice
par: Lee, Jinwoo, et autres
Publié: (2026)
par: Lee, Jinwoo, et autres
Publié: (2026)
Revisiting Reliability in the Reasoning-based Pose Estimation Benchmark
par: Kim, Junsu, et autres
Publié: (2025)
par: Kim, Junsu, et autres
Publié: (2025)
A Quantitative and Qualitative Evaluation of LLM-Based Explainable Fault Localization
par: Kang, Sungmin, et autres
Publié: (2023)
par: Kang, Sungmin, et autres
Publié: (2023)
Restoration-Aligned Generative Flow Models for Blind Motion Deblurring
par: Kim, Insoo, et autres
Publié: (2026)
par: Kim, Insoo, et autres
Publié: (2026)
MambaSL: Exploring Single-Layer Mamba for Time Series Classification
par: Jung, Yoo-Min, et autres
Publié: (2026)
par: Jung, Yoo-Min, et autres
Publié: (2026)
Do E-Scooter Speed Governance Policies Reduce Harsh Acceleration and Deceleration? Evidence from 19.5 Million Trips Around a Regulatory Ban
par: Choi, Seongjin, et autres
Publié: (2026)
par: Choi, Seongjin, et autres
Publié: (2026)
Domain-Agnostic Scalable AI Safety Ensuring Framework
par: Kim, Beomjun, et autres
Publié: (2025)
par: Kim, Beomjun, et autres
Publié: (2025)
Investigating the Integrated Digital Interventions Delivered by a Therapeutic Companion Agent for Young Adults with Symptoms of Depression: A Proof-of-Concept Study
par: Yoo, Youngjae, et autres
Publié: (2025)
par: Yoo, Youngjae, et autres
Publié: (2025)
MobileRAG: A Fast, Memory-Efficient, and Energy-Efficient Method for On-Device RAG
par: Park, Taehwan, et autres
Publié: (2025)
par: Park, Taehwan, et autres
Publié: (2025)
Predictive Prompt Analysis
par: Lee, Jae Yong, et autres
Publié: (2025)
par: Lee, Jae Yong, et autres
Publié: (2025)
Training Time Prediction for Mixed Precision-based Distributed Training
par: Kang, Minchul, et autres
Publié: (2026)
par: Kang, Minchul, et autres
Publié: (2026)
Capturing Semantic Flow of ML-based Systems
par: Yoo, Shin, et autres
Publié: (2025)
par: Yoo, Shin, et autres
Publié: (2025)
Analyzing the Training Dynamics of Image Restoration Transformers: A Revisit to Layer Normalization
par: Lee, MinKyu, et autres
Publié: (2025)
par: Lee, MinKyu, et autres
Publié: (2025)
Effect of a Manager in Relational Contracts with Multiple Workers
par: Kim, Beomjun
Publié: (2025)
par: Kim, Beomjun
Publié: (2025)
Normalized Convolutional Neural Network
par: Kim, Dongsuk, et autres
Publié: (2020)
par: Kim, Dongsuk, et autres
Publié: (2020)
Documents similaires
-
ReGUIDE: Data Efficient GUI Grounding via Spatial Reasoning and Search
par: Lee, Hyunseok, et autres
Publié: (2025) -
Enhancing Hallucination Detection via Future Context
par: Lee, Joosung, et autres
Publié: (2025) -
Cross-lingual Collapse: How Language-Centric Foundation Models Shape Reasoning in Large Language Models
par: Park, Cheonbok, et autres
Publié: (2025) -
CSA-Trans: Code Structure Aware Transformer for AST
par: Oh, Saeyoon, et autres
Publié: (2024) -
Efficient LLM Collaboration via Planning
par: Lee, Byeongchan, et autres
Publié: (2025)