ScaleFormer: Span Representation Cumulation for Long-Context Transformer
Fuente:
arXiv
Salvato in:
| Autori principali: | Du, Jiangshu, Yin, Wenpeng, Yu, Philip |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Cross-Scale Pansharpening via ScaleFormer and the PanScale Benchmark
di: Cao, Ke, et al.
Pubblicazione: (2026)
di: Cao, Ke, et al.
Pubblicazione: (2026)
FOFO: A Benchmark to Evaluate LLMs' Format-Following Capability
di: Xia, Congying, et al.
Pubblicazione: (2024)
di: Xia, Congying, et al.
Pubblicazione: (2024)
LLMs' Classification Performance is Overclaimed
di: Xu, Hanzi, et al.
Pubblicazione: (2024)
di: Xu, Hanzi, et al.
Pubblicazione: (2024)
Could AI Trace and Explain the Origins of AI-Generated Images and Text?
di: Fang, Hongchao, et al.
Pubblicazione: (2025)
di: Fang, Hongchao, et al.
Pubblicazione: (2025)
TempoFormer: A Transformer for Temporally-aware Representations in Change Detection
di: Tseriotou, Talia, et al.
Pubblicazione: (2024)
di: Tseriotou, Talia, et al.
Pubblicazione: (2024)
Toward Zero-Shot Instruction Following
di: Lou, Renze, et al.
Pubblicazione: (2023)
di: Lou, Renze, et al.
Pubblicazione: (2023)
MultiFileTest: A Multi-File-Level LLM Unit Test Generation Benchmark and Impact of Error Fixing Mechanisms
di: Wang, Yibo, et al.
Pubblicazione: (2025)
di: Wang, Yibo, et al.
Pubblicazione: (2025)
UncertaintyRAG: Span-Level Uncertainty Enhanced Long-Context Modeling for Retrieval-Augmented Generation
di: Li, Zixuan, et al.
Pubblicazione: (2024)
di: Li, Zixuan, et al.
Pubblicazione: (2024)
Beyond End-to-End VLMs: Leveraging Intermediate Text Representations for Superior Flowchart Understanding
di: Ye, Junyi, et al.
Pubblicazione: (2024)
di: Ye, Junyi, et al.
Pubblicazione: (2024)
Prompt-Reverse Inconsistency: LLM Self-Inconsistency Beyond Generative Randomness and Prompt Paraphrasing
di: Ahn, Jihyun Janice, et al.
Pubblicazione: (2025)
di: Ahn, Jihyun Janice, et al.
Pubblicazione: (2025)
DySCO: Dynamic Attention-Scaling Decoding for Long-Context Language Models
di: Ye, Xi, et al.
Pubblicazione: (2026)
di: Ye, Xi, et al.
Pubblicazione: (2026)
Scaling Context, Not Parameters: Training a Compact 7B Language Model for Efficient Long-Context Processing
di: Wu, Chen, et al.
Pubblicazione: (2025)
di: Wu, Chen, et al.
Pubblicazione: (2025)
In-Context Former: Lightning-fast Compressing Context for Large Language Model
di: Wang, Xiangfeng, et al.
Pubblicazione: (2024)
di: Wang, Xiangfeng, et al.
Pubblicazione: (2024)
Wavelet-based Positional Representation for Long Context
di: Oka, Yui, et al.
Pubblicazione: (2025)
di: Oka, Yui, et al.
Pubblicazione: (2025)
Large Language Model Instruction Following: A Survey of Progresses and Challenges
di: Lou, Renze, et al.
Pubblicazione: (2023)
di: Lou, Renze, et al.
Pubblicazione: (2023)
M2-Verify: A Large-Scale Multidomain Benchmark for Checking Multimodal Claim Consistency
di: Ansari, Abolfazl, et al.
Pubblicazione: (2026)
di: Ansari, Abolfazl, et al.
Pubblicazione: (2026)
Scaling Bidirectional Spans and Span Violations in Attention Mechanism
di: Kim, Jongwook, et al.
Pubblicazione: (2025)
di: Kim, Jongwook, et al.
Pubblicazione: (2025)
LongVILA: Scaling Long-Context Visual Language Models for Long Videos
di: Chen, Yukang, et al.
Pubblicazione: (2024)
di: Chen, Yukang, et al.
Pubblicazione: (2024)
COMPACT: Common-token Optimized Model Pruning Across Channels and Tokens
di: Kwek, Eugene, et al.
Pubblicazione: (2025)
di: Kwek, Eugene, et al.
Pubblicazione: (2025)
SRA: Span Representation Alignment for Large Language Model Distillation
di: Dao, Quoc Phong, et al.
Pubblicazione: (2026)
di: Dao, Quoc Phong, et al.
Pubblicazione: (2026)
WildLong: Synthesizing Realistic Long-Context Instruction Data at Scale
di: Li, Jiaxi, et al.
Pubblicazione: (2025)
di: Li, Jiaxi, et al.
Pubblicazione: (2025)
Insights into LLM Long-Context Failures: When Transformers Know but Don't Tell
di: Lu, Taiming, et al.
Pubblicazione: (2024)
di: Lu, Taiming, et al.
Pubblicazione: (2024)
$π$-Attention: Periodic Sparse Transformers for Efficient Long-Context Modeling
di: Liu, Dong, et al.
Pubblicazione: (2025)
di: Liu, Dong, et al.
Pubblicazione: (2025)
Latent-Condensed Transformer for Efficient Long Context Modeling
di: You, Zeng, et al.
Pubblicazione: (2026)
di: You, Zeng, et al.
Pubblicazione: (2026)
Inference Scaling for Long-Context Retrieval Augmented Generation
di: Yue, Zhenrui, et al.
Pubblicazione: (2024)
di: Yue, Zhenrui, et al.
Pubblicazione: (2024)
RecurFormer: Not All Transformer Heads Need Self-Attention
di: Yan, Ruiqing, et al.
Pubblicazione: (2024)
di: Yan, Ruiqing, et al.
Pubblicazione: (2024)
Functionality-Oriented LLM Merging on the Fisher--Rao Manifold
di: Wang, Jiayu, et al.
Pubblicazione: (2026)
di: Wang, Jiayu, et al.
Pubblicazione: (2026)
Core Context Aware Transformers for Long Context Language Modeling
di: Chen, Yaofo, et al.
Pubblicazione: (2024)
di: Chen, Yaofo, et al.
Pubblicazione: (2024)
LongReason: A Synthetic Long-Context Reasoning Benchmark via Context Expansion
di: Ling, Zhan, et al.
Pubblicazione: (2025)
di: Ling, Zhan, et al.
Pubblicazione: (2025)
Understanding Dynamic Compute Allocation in Recurrent Transformers
di: Moosa, Ibraheem Muhammad, et al.
Pubblicazione: (2026)
di: Moosa, Ibraheem Muhammad, et al.
Pubblicazione: (2026)
HERA: Improving Long Document Summarization using Large Language Models with Context Packaging and Reordering
di: Li, Taiji, et al.
Pubblicazione: (2025)
di: Li, Taiji, et al.
Pubblicazione: (2025)
Equipping Transformer with Random-Access Reading for Long-Context Understanding
di: Yang, Chenghao, et al.
Pubblicazione: (2024)
di: Yang, Chenghao, et al.
Pubblicazione: (2024)
Training-Free Long-Context Scaling of Large Language Models
di: An, Chenxin, et al.
Pubblicazione: (2024)
di: An, Chenxin, et al.
Pubblicazione: (2024)
AAAR-1.0: Assessing AI's Potential to Assist Research
di: Lou, Renze, et al.
Pubblicazione: (2024)
di: Lou, Renze, et al.
Pubblicazione: (2024)
LongProc: Benchmarking Long-Context Language Models on Long Procedural Generation
di: Ye, Xi, et al.
Pubblicazione: (2025)
di: Ye, Xi, et al.
Pubblicazione: (2025)
ResFormer: All-Time Reservoir Memory for Long Sequence Classification
di: Liu, Hongbo, et al.
Pubblicazione: (2025)
di: Liu, Hongbo, et al.
Pubblicazione: (2025)
Long-Short Alignment for Effective Long-Context Modeling in LLMs
di: Du, Tianqi, et al.
Pubblicazione: (2025)
di: Du, Tianqi, et al.
Pubblicazione: (2025)
Efficient Prompt Compression with Evaluator Heads for Long-Context Transformer Inference
di: Fei, Weizhi, et al.
Pubblicazione: (2025)
di: Fei, Weizhi, et al.
Pubblicazione: (2025)
Anti-Overestimation Dialogue Policy Learning for Task-Completion Dialogue System
di: Tian, Chang, et al.
Pubblicazione: (2022)
di: Tian, Chang, et al.
Pubblicazione: (2022)
Layer-Specific Scaling of Positional Encodings for Superior Long-Context Modeling
di: Wang, Zhenghua, et al.
Pubblicazione: (2025)
di: Wang, Zhenghua, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Cross-Scale Pansharpening via ScaleFormer and the PanScale Benchmark
di: Cao, Ke, et al.
Pubblicazione: (2026) -
FOFO: A Benchmark to Evaluate LLMs' Format-Following Capability
di: Xia, Congying, et al.
Pubblicazione: (2024) -
LLMs' Classification Performance is Overclaimed
di: Xu, Hanzi, et al.
Pubblicazione: (2024) -
Could AI Trace and Explain the Origins of AI-Generated Images and Text?
di: Fang, Hongchao, et al.
Pubblicazione: (2025) -
TempoFormer: A Transformer for Temporally-aware Representations in Change Detection
di: Tseriotou, Talia, et al.
Pubblicazione: (2024)