EdgeInfinite: A Memory-Efficient Infinite-Context Transformer for Edge Devices
Fuente:
arXiv
Guardado en:
| Autores principales: | Chen, Jiyu, Peng, Shuang, Luo, Daxiong, Yang, Fan, Wu, Renshou, Li, Fangyuan, Chen, Xiaoxin |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
EdgeInfinite-Instruct: Bridging SFT-Based Optimization and NPU-Level Efficiency for Edge Devices
por: Chen, Jiyu, et al.
Publicado: (2025)
por: Chen, Jiyu, et al.
Publicado: (2025)
SmartBench: Is Your LLM Truly a Good Chinese Smartphone Assistant?
por: Lu, Xudong, et al.
Publicado: (2025)
por: Lu, Xudong, et al.
Publicado: (2025)
GenieBlue: Integrating both Linguistic and Multimodal Capabilities for Large Language Models on Mobile Devices
por: Lu, Xudong, et al.
Publicado: (2025)
por: Lu, Xudong, et al.
Publicado: (2025)
Leave No Context Behind: Efficient Infinite Context Transformers with Infini-attention
por: Munkhdalai, Tsendsuren, et al.
Publicado: (2024)
por: Munkhdalai, Tsendsuren, et al.
Publicado: (2024)
GSM-Infinite: How Do Your LLMs Behave over Infinitely Increasing Context Length and Reasoning Complexity?
por: Zhou, Yang, et al.
Publicado: (2025)
por: Zhou, Yang, et al.
Publicado: (2025)
InfiniPot: Infinite Context Processing on Memory-Constrained LLMs
por: Kim, Minsoo, et al.
Publicado: (2024)
por: Kim, Minsoo, et al.
Publicado: (2024)
Human-inspired Episodic Memory for Infinite Context LLMs
por: Fountas, Zafeirios, et al.
Publicado: (2024)
por: Fountas, Zafeirios, et al.
Publicado: (2024)
InfiniteICL: Breaking the Limit of Context Window Size via Long Short-term Memory Transformation
por: Cao, Bowen, et al.
Publicado: (2025)
por: Cao, Bowen, et al.
Publicado: (2025)
HyperVL: An Efficient and Dynamic Multimodal Large Language Model for Edge Devices
por: HyperAI Team, et al.
Publicado: (2025)
por: HyperAI Team, et al.
Publicado: (2025)
Towards Infinite-Long Prefix in Transformer
por: Liang, Yingyu, et al.
Publicado: (2024)
por: Liang, Yingyu, et al.
Publicado: (2024)
Folded Context Condensation in Path Integral Formalism for Infinite Context Transformers
por: Paeng, Won-Gi, et al.
Publicado: (2024)
por: Paeng, Won-Gi, et al.
Publicado: (2024)
Periodic RoPE for Infinite Context LLMs
por: Huo, Simin
Publicado: (2026)
por: Huo, Simin
Publicado: (2026)
Infinite Retrieval: Attention Enhanced LLMs in Long-Context Processing
por: Ye, Xiaoju, et al.
Publicado: (2025)
por: Ye, Xiaoju, et al.
Publicado: (2025)
Finding Transformer Circuits with Edge Pruning
por: Bhaskar, Adithya, et al.
Publicado: (2024)
por: Bhaskar, Adithya, et al.
Publicado: (2024)
FAEDKV: Infinite-Window Fourier Transform for Unbiased KV Cache Compression
por: Li, Runchao, et al.
Publicado: (2025)
por: Li, Runchao, et al.
Publicado: (2025)
ReAttention: Training-Free Infinite Context with Finite Attention Scope
por: Liu, Xiaoran, et al.
Publicado: (2024)
por: Liu, Xiaoran, et al.
Publicado: (2024)
Cognitive Workspace: Active Memory Management for LLMs -- An Empirical Study of Functional Infinite Context
por: An, Tao
Publicado: (2025)
por: An, Tao
Publicado: (2025)
Human-Like Lifelong Memory: A Neuroscience-Grounded Architecture for Infinite Interaction
por: Lerma-Torres, Diego C.
Publicado: (2026)
por: Lerma-Torres, Diego C.
Publicado: (2026)
BitMar: Low-Bit Multimodal Fusion with Episodic Memory for Edge Devices
por: Aman, Euhid, et al.
Publicado: (2025)
por: Aman, Euhid, et al.
Publicado: (2025)
SirLLM: Streaming Infinite Retentive LLM
por: Yao, Yao, et al.
Publicado: (2024)
por: Yao, Yao, et al.
Publicado: (2024)
AuroraEdge-V-2B: A Faster And Stronger Edge Visual Large Language Model
por: Chen, Xiang
Publicado: (2026)
por: Chen, Xiang
Publicado: (2026)
BlueLM-V-3B: Algorithm and System Co-Design for Multimodal Large Language Models on Mobile Devices
por: Lu, Xudong, et al.
Publicado: (2024)
por: Lu, Xudong, et al.
Publicado: (2024)
LM-Infinite: Zero-Shot Extreme Length Generalization for Large Language Models
por: Han, Chi, et al.
Publicado: (2023)
por: Han, Chi, et al.
Publicado: (2023)
An Infinite Needle in a Finite Haystack: Finding Infinite Counter-Models in Deductive Verification
por: Elad, Neta, et al.
Publicado: (2023)
por: Elad, Neta, et al.
Publicado: (2023)
Efficient Reasoning on the Edge
por: Bondarenko, Yelysei, et al.
Publicado: (2026)
por: Bondarenko, Yelysei, et al.
Publicado: (2026)
Out of the Memory Barrier: A Highly Memory Efficient Training System for LLMs with Million-Token Contexts
por: Li, Wenhao, et al.
Publicado: (2026)
por: Li, Wenhao, et al.
Publicado: (2026)
Predicting Emergent Abilities with Infinite Resolution Evaluation
por: Hu, Shengding, et al.
Publicado: (2023)
por: Hu, Shengding, et al.
Publicado: (2023)
InftyThink+: Effective and Efficient Infinite-Horizon Reasoning via Reinforcement Learning
por: Yan, Yuchen, et al.
Publicado: (2026)
por: Yan, Yuchen, et al.
Publicado: (2026)
Close the Loop: Synthesizing Infinite Tool-Use Data via Multi-Agent Role-Playing
por: Li, Yuwen, et al.
Publicado: (2025)
por: Li, Yuwen, et al.
Publicado: (2025)
MemPrivacy: Privacy-Preserving Personalized Memory Management for Edge-Cloud Agents
por: Chen, Yining, et al.
Publicado: (2026)
por: Chen, Yining, et al.
Publicado: (2026)
Latent-Condensed Transformer for Efficient Long Context Modeling
por: You, Zeng, et al.
Publicado: (2026)
por: You, Zeng, et al.
Publicado: (2026)
Token Level Routing Inference System for Edge Devices
por: She, Jianshu, et al.
Publicado: (2025)
por: She, Jianshu, et al.
Publicado: (2025)
Squid: Long Context as a New Modality for Energy-Efficient On-Device Language Models
por: Chen, Wei, et al.
Publicado: (2024)
por: Chen, Wei, et al.
Publicado: (2024)
ShED-HD: A Shannon Entropy Distribution Framework for Lightweight Hallucination Detection on Edge Devices
por: Vathul, Aneesh, et al.
Publicado: (2025)
por: Vathul, Aneesh, et al.
Publicado: (2025)
Multi Agent based Medical Assistant for Edge Devices
por: Gawade, Sakharam, et al.
Publicado: (2025)
por: Gawade, Sakharam, et al.
Publicado: (2025)
Medicine on the Edge: Comparative Performance Analysis of On-Device LLMs for Clinical Reasoning
por: Nissen, Leon, et al.
Publicado: (2025)
por: Nissen, Leon, et al.
Publicado: (2025)
StreamingVLM: Real-Time Understanding for Infinite Video Streams
por: Xu, Ruyi, et al.
Publicado: (2025)
por: Xu, Ruyi, et al.
Publicado: (2025)
Crayon: Customized On-Device LLM via Instant Adapter Blending and Edge-Server Hybrid Inference
por: Bang, Jihwan, et al.
Publicado: (2024)
por: Bang, Jihwan, et al.
Publicado: (2024)
A Two-Phase Infinite/Finite Low-Level Memory Model
por: Beck, Calvin, et al.
Publicado: (2024)
por: Beck, Calvin, et al.
Publicado: (2024)
Infinite Mask Diffusion for Few-Step Distillation
por: Yoo, Jaehoon, et al.
Publicado: (2026)
por: Yoo, Jaehoon, et al.
Publicado: (2026)
Ejemplares similares
-
EdgeInfinite-Instruct: Bridging SFT-Based Optimization and NPU-Level Efficiency for Edge Devices
por: Chen, Jiyu, et al.
Publicado: (2025) -
SmartBench: Is Your LLM Truly a Good Chinese Smartphone Assistant?
por: Lu, Xudong, et al.
Publicado: (2025) -
GenieBlue: Integrating both Linguistic and Multimodal Capabilities for Large Language Models on Mobile Devices
por: Lu, Xudong, et al.
Publicado: (2025) -
Leave No Context Behind: Efficient Infinite Context Transformers with Infini-attention
por: Munkhdalai, Tsendsuren, et al.
Publicado: (2024) -
GSM-Infinite: How Do Your LLMs Behave over Infinitely Increasing Context Length and Reasoning Complexity?
por: Zhou, Yang, et al.
Publicado: (2025)