Enregistré dans:
| Auteurs principaux: | Cheng, Xin, Zeng, Wangding, Dai, Damai, Chen, Qinyu, Wang, Bingxuan, Xie, Zhenda, Huang, Kezhao, Yu, Xingkai, Hao, Zhewen, Li, Yukun, Zhang, Han, Zhang, Huishuai, Zhao, Dongyan, Liang, Wenfeng |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | https://arxiv.org/abs/2601.07372 |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Native Sparse Attention: Hardware-Aligned and Natively Trainable Sparse Attention
par: Yuan, Jingyang, et autres
Publié: (2025)
par: Yuan, Jingyang, et autres
Publié: (2025)
DeepSeekMoE: Towards Ultimate Expert Specialization in Mixture-of-Experts Language Models
par: Dai, Damai, et autres
Publié: (2024)
par: Dai, Damai, et autres
Publié: (2024)
MAC-Lookup: Multi-Axis Conditional Lookup Model for Underwater Image Enhancement
par: Yi, Fanghai, et autres
Publié: (2025)
par: Yi, Fanghai, et autres
Publié: (2025)
Evidence-Enhanced Triplet Generation Framework for Hallucination Alleviation in Generative Question Answering
par: Du, Haowei, et autres
Publié: (2024)
par: Du, Haowei, et autres
Publié: (2024)
mHC: Manifold-Constrained Hyper-Connections
par: Xie, Zhenda, et autres
Publié: (2025)
par: Xie, Zhenda, et autres
Publié: (2025)
Understanding Multimodal Hallucination with Parameter-Free Representation Alignment
par: Wang, Yueqian, et autres
Publié: (2024)
par: Wang, Yueqian, et autres
Publié: (2024)
DeepSeek-Coder-V2: Breaking the Barrier of Closed-Source Models in Code Intelligence
par: DeepSeek-AI, et autres
Publié: (2024)
par: DeepSeek-AI, et autres
Publié: (2024)
TupleChain: Fast Lookup of OpenFlow Table with Multifaceted Scalability
par: Li, Yanbiao, et autres
Publié: (2024)
par: Li, Yanbiao, et autres
Publié: (2024)
ReasVQA: Advancing VideoQA with Imperfect Reasoning Process
par: Liang, Jianxin, et autres
Publié: (2025)
par: Liang, Jianxin, et autres
Publié: (2025)
FREAK: A Fine-grained Hallucination Evaluation Benchmark for Advanced MLLMs
par: Yin, Zhihan, et autres
Publié: (2026)
par: Yin, Zhihan, et autres
Publié: (2026)
Latent Preference Coding: Aligning Large Language Models via Discrete Latent Codes
par: Gong, Zhuocheng, et autres
Publié: (2025)
par: Gong, Zhuocheng, et autres
Publié: (2025)
Efficient Continual Pre-training by Mitigating the Stability Gap
par: Guo, Yiduo, et autres
Publié: (2024)
par: Guo, Yiduo, et autres
Publié: (2024)
ProactiveVideoQA: A Comprehensive Benchmark Evaluating Proactive Interactions in Video Large Language Models
par: Wang, Yueqian, et autres
Publié: (2025)
par: Wang, Yueqian, et autres
Publié: (2025)
DeepSeek-VL2: Mixture-of-Experts Vision-Language Models for Advanced Multimodal Understanding
par: Wu, Zhiyu, et autres
Publié: (2024)
par: Wu, Zhiyu, et autres
Publié: (2024)
Multi-Satellite Beam Hopping and Power Allocation Using Deep Reinforcement Learning
par: Xie, Xia, et autres
Publié: (2025)
par: Xie, Xia, et autres
Publié: (2025)
Beyond Isolated Facts: Synthesizing Narrative and Grounded Supervision for VideoQA
par: Liang, Jianxin, et autres
Publié: (2025)
par: Liang, Jianxin, et autres
Publié: (2025)
VideoLLM Knows When to Speak: Enhancing Time-Sensitive Video Comprehension with Video-Text Duet Interaction Format
par: Wang, Yueqian, et autres
Publié: (2024)
par: Wang, Yueqian, et autres
Publié: (2024)
xRAG: Extreme Context Compression for Retrieval-augmented Generation with One Token
par: Cheng, Xin, et autres
Publié: (2024)
par: Cheng, Xin, et autres
Publié: (2024)
Shorten After You're Right: Lazy Length Penalties for Reasoning RL
par: Yuan, Danlong, et autres
Publié: (2025)
par: Yuan, Danlong, et autres
Publié: (2025)
The Collusion of Memory and Nonlinearity in Stochastic Approximation With Constant Stepsize
par: Huo, Dongyan, et autres
Publié: (2024)
par: Huo, Dongyan, et autres
Publié: (2024)
Janus-Pro: Unified Multimodal Understanding and Generation with Data and Model Scaling
par: Chen, Xiaokang, et autres
Publié: (2025)
par: Chen, Xiaokang, et autres
Publié: (2025)
Exploring Activation Patterns of Parameters in Language Models
par: Wang, Yudong, et autres
Publié: (2024)
par: Wang, Yudong, et autres
Publié: (2024)
Language Models Encode the Value of Numbers Linearly
par: Zhu, Fangwei, et autres
Publié: (2024)
par: Zhu, Fangwei, et autres
Publié: (2024)
De-Anonymization at Scale via Tournament-Style Attribution
par: Zhang, Lirui, et autres
Publié: (2026)
par: Zhang, Lirui, et autres
Publié: (2026)
SWE-MiniSandbox: Container-Free Reinforcement Learning for Building Software Engineering Agents
par: Yuan, Danlong, et autres
Publié: (2026)
par: Yuan, Danlong, et autres
Publié: (2026)
ReMamba: Equip Mamba with Effective Long-Sequence Modeling
par: Yuan, Danlong, et autres
Publié: (2024)
par: Yuan, Danlong, et autres
Publié: (2024)
MMDuet2: Enhancing Proactive Interaction of Video MLLMs with Multi-Turn Reinforcement Learning
par: Wang, Yueqian, et autres
Publié: (2025)
par: Wang, Yueqian, et autres
Publié: (2025)
Two-Step Diffusion: Fast Sampling and Reliable Prediction for 3D Keller--Segel and KPP Equations in Fluid Flows
par: Shen, Zhenda, et autres
Publié: (2026)
par: Shen, Zhenda, et autres
Publié: (2026)
Invertible Bloom Lookup Tables with Less Memory and Randomness
par: Fleischhacker, Nils, et autres
Publié: (2023)
par: Fleischhacker, Nils, et autres
Publié: (2023)
Not All Demonstration Examples are Equally Beneficial: Reweighting Demonstration Examples for In-Context Learning
par: Yang, Zhe, et autres
Publié: (2023)
par: Yang, Zhe, et autres
Publié: (2023)
Lego Sketch: A Scalable Memory-augmented Neural Network for Sketching Data Streams
par: Feng, Yuan, et autres
Publié: (2025)
par: Feng, Yuan, et autres
Publié: (2025)
SMES: Towards Scalable Multi-Task Recommendation via Expert Sparsity
par: Zhang, Yukun, et autres
Publié: (2026)
par: Zhang, Yukun, et autres
Publié: (2026)
LOOKAT: Lookup-Optimized Key-Attention for Memory-Efficient Transformers
par: Karmore, Aryan
Publié: (2026)
par: Karmore, Aryan
Publié: (2026)
Beyond Dense Connectivity: Explicit Sparsity for Scalable Recommendation
par: Yu, Yantao, et autres
Publié: (2026)
par: Yu, Yantao, et autres
Publié: (2026)
Asymptotic Product-form Steady-state for Multiclass Queueing Networks: A Reentrant Line Case Study
par: Dai, Jim, et autres
Publié: (2024)
par: Dai, Jim, et autres
Publié: (2024)
DeltaLLM: A Training-Free Framework Exploiting Temporal Sparsity for Efficient Edge LLM Inference
par: Qi, Jiawen, et autres
Publié: (2025)
par: Qi, Jiawen, et autres
Publié: (2025)
StyleChat: Learning Recitation-Augmented Memory in LLMs for Stylized Dialogue Generation
par: Li, Jinpeng, et autres
Publié: (2024)
par: Li, Jinpeng, et autres
Publié: (2024)
Beyond Fixed Benchmarks and Worst-Case Attacks: Dynamic Boundary Evaluation for Language Models
par: Wang, Haoxiang, et autres
Publié: (2026)
par: Wang, Haoxiang, et autres
Publié: (2026)
OLion: Approaching the Hadamard Ideal by Intersecting Spectral and $\ell_{\infty}$ Implicit Biases
par: Wang, Zixiao, et autres
Publié: (2026)
par: Wang, Zixiao, et autres
Publié: (2026)
GeoBuildBench: A Benchmark for Interactive and Executable Geometry Construction from Natural Language
par: Kim, Jinwoong, et autres
Publié: (2026)
par: Kim, Jinwoong, et autres
Publié: (2026)
Documents similaires
-
Native Sparse Attention: Hardware-Aligned and Natively Trainable Sparse Attention
par: Yuan, Jingyang, et autres
Publié: (2025) -
DeepSeekMoE: Towards Ultimate Expert Specialization in Mixture-of-Experts Language Models
par: Dai, Damai, et autres
Publié: (2024) -
MAC-Lookup: Multi-Axis Conditional Lookup Model for Underwater Image Enhancement
par: Yi, Fanghai, et autres
Publié: (2025) -
Evidence-Enhanced Triplet Generation Framework for Hallucination Alleviation in Generative Question Answering
par: Du, Haowei, et autres
Publié: (2024) -
mHC: Manifold-Constrained Hyper-Connections
par: Xie, Zhenda, et autres
Publié: (2025)