Perceiving Longer Sequences With Bi-Directional Cross-Attention Transformers
Fuente:
arXiv
Salvato in:
| Autori principali: | Hiller, Markus, Ehinger, Krista A., Drummond, Tom |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Improving Denoising Diffusion Models via Simultaneous Estimation of Image and Noise
di: Zhang, Zhenkai, et al.
Pubblicazione: (2023)
di: Zhang, Zhenkai, et al.
Pubblicazione: (2023)
Sequential Amodal Segmentation via Cumulative Occlusion Learning
di: Ao, Jiayang, et al.
Pubblicazione: (2024)
di: Ao, Jiayang, et al.
Pubblicazione: (2024)
Open-World Amodal Appearance Completion
di: Ao, Jiayang, et al.
Pubblicazione: (2024)
di: Ao, Jiayang, et al.
Pubblicazione: (2024)
KALE: An Artwork Image Captioning System Augmented with Heterogeneous Graph
di: Jiang, Yanbei, et al.
Pubblicazione: (2024)
di: Jiang, Yanbei, et al.
Pubblicazione: (2024)
PROPA: Toward Process-level Optimization in Visual Reasoning via Reinforcement Learning
di: Jiang, Yanbei, et al.
Pubblicazione: (2025)
di: Jiang, Yanbei, et al.
Pubblicazione: (2025)
Beyond Augmentation: Cross-Modal Transformer Fusion with Bi-directional Attention for Low-Data Aneurysm Screening
di: Titikhsha, Antara, et al.
Pubblicazione: (2025)
di: Titikhsha, Antara, et al.
Pubblicazione: (2025)
DeBiFormer: Vision Transformer with Deformable Agent Bi-level Routing Attention
di: Long, Nguyen Huu Bao, et al.
Pubblicazione: (2024)
di: Long, Nguyen Huu Bao, et al.
Pubblicazione: (2024)
AdaReTaKe: Adaptive Redundancy Reduction to Perceive Longer for Video-language Understanding
di: Wang, Xiao, et al.
Pubblicazione: (2025)
di: Wang, Xiao, et al.
Pubblicazione: (2025)
Beyond Perception: Evaluating Abstract Visual Reasoning through Multi-Stage Task
di: Jiang, Yanbei, et al.
Pubblicazione: (2025)
di: Jiang, Yanbei, et al.
Pubblicazione: (2025)
EViT: An Eagle Vision Transformer with Bi-Fovea Self-Attention
di: Shi, Yulong, et al.
Pubblicazione: (2023)
di: Shi, Yulong, et al.
Pubblicazione: (2023)
Reasoning Like Experts: Leveraging Multimodal Large Language Models for Drawing-based Psychoanalysis
di: Ma, Xueqi, et al.
Pubblicazione: (2025)
di: Ma, Xueqi, et al.
Pubblicazione: (2025)
Analysis of Attention in Video Diffusion Transformers
di: Wen, Yuxin, et al.
Pubblicazione: (2025)
di: Wen, Yuxin, et al.
Pubblicazione: (2025)
Cross-modulated Attention Transformer for RGBT Tracking
di: Xiao, Yun, et al.
Pubblicazione: (2024)
di: Xiao, Yun, et al.
Pubblicazione: (2024)
CrossLMM: Decoupling Long Video Sequences from LMMs via Dual Cross-Attention Mechanisms
di: Yan, Shilin, et al.
Pubblicazione: (2025)
di: Yan, Shilin, et al.
Pubblicazione: (2025)
LookHere: Vision Transformers with Directed Attention Generalize and Extrapolate
di: Fuller, Anthony, et al.
Pubblicazione: (2024)
di: Fuller, Anthony, et al.
Pubblicazione: (2024)
LoL: Longer than Longer, Scaling Video Generation to Hour
di: Cui, Justin, et al.
Pubblicazione: (2026)
di: Cui, Justin, et al.
Pubblicazione: (2026)
Controllable Longer Image Animation with Diffusion Models
di: Wang, Qiang, et al.
Pubblicazione: (2024)
di: Wang, Qiang, et al.
Pubblicazione: (2024)
ACIT: Attention-Guided Cross-Modal Interaction Transformer for Pedestrian Crossing Intention Prediction
di: Li, Yuanzhe, et al.
Pubblicazione: (2025)
di: Li, Yuanzhe, et al.
Pubblicazione: (2025)
StreetForward: Perceiving Dynamic Street with Feedforward Causal Attention
di: Yu, Zhongrui, et al.
Pubblicazione: (2026)
di: Yu, Zhongrui, et al.
Pubblicazione: (2026)
DiTCtrl: Exploring Attention Control in Multi-Modal Diffusion Transformer for Tuning-Free Multi-Prompt Longer Video Generation
di: Cai, Minghong, et al.
Pubblicazione: (2024)
di: Cai, Minghong, et al.
Pubblicazione: (2024)
RGB-Sonar Tracking Benchmark and Spatial Cross-Attention Transformer Tracker
di: Li, Yunfeng, et al.
Pubblicazione: (2024)
di: Li, Yunfeng, et al.
Pubblicazione: (2024)
Estimating Extreme 3D Image Rotation with Transformer Cross-Attention
di: Dekel, Shay, et al.
Pubblicazione: (2023)
di: Dekel, Shay, et al.
Pubblicazione: (2023)
Event-Based Motion Segmentation by Motion Compensation
di: Stoffregen, Timo, et al.
Pubblicazione: (2019)
di: Stoffregen, Timo, et al.
Pubblicazione: (2019)
Admitting Ignorance Helps the Video Question Answering Models to Answer
di: Li, Haopeng, et al.
Pubblicazione: (2025)
di: Li, Haopeng, et al.
Pubblicazione: (2025)
ROI-Aware Multiscale Cross-Attention Vision Transformer for Pest Image Identification
di: Kim, Ga-Eun, et al.
Pubblicazione: (2023)
di: Kim, Ga-Eun, et al.
Pubblicazione: (2023)
DBAT: Dynamic Backward Attention Transformer for Material Segmentation with Cross-Resolution Patches
di: Heng, Yuwen, et al.
Pubblicazione: (2023)
di: Heng, Yuwen, et al.
Pubblicazione: (2023)
Embedded Heterogeneous Attention Transformer for Cross-lingual Image Captioning
di: Song, Zijie, et al.
Pubblicazione: (2023)
di: Song, Zijie, et al.
Pubblicazione: (2023)
Multimodal Emotion Recognition via Bi-directional Cross-Attention and Temporal Modeling
di: Byeon, Junhyeong, et al.
Pubblicazione: (2026)
di: Byeon, Junhyeong, et al.
Pubblicazione: (2026)
Bi-Directional Deep Contextual Video Compression
di: Sheng, Xihua, et al.
Pubblicazione: (2024)
di: Sheng, Xihua, et al.
Pubblicazione: (2024)
Personalized Image Descriptions from Attention Sequences
di: Xue, Ruoyu, et al.
Pubblicazione: (2025)
di: Xue, Ruoyu, et al.
Pubblicazione: (2025)
Direct Visual Grounding by Directing Attention of Visual Tokens
di: Esmaeilkhani, Parsa, et al.
Pubblicazione: (2025)
di: Esmaeilkhani, Parsa, et al.
Pubblicazione: (2025)
Attention Normalization Impacts Cardinality Generalization in Slot Attention
di: Krimmel, Markus, et al.
Pubblicazione: (2024)
di: Krimmel, Markus, et al.
Pubblicazione: (2024)
FreeNoise: Tuning-Free Longer Video Diffusion via Noise Rescheduling
di: Qiu, Haonan, et al.
Pubblicazione: (2023)
di: Qiu, Haonan, et al.
Pubblicazione: (2023)
Free Geometry: Refining 3D Reconstruction from Longer Versions of Itself
di: Dai, Yuhang, et al.
Pubblicazione: (2026)
di: Dai, Yuhang, et al.
Pubblicazione: (2026)
DeforHMR: Vision Transformer with Deformable Cross-Attention for 3D Human Mesh Recovery
di: Heo, Jaewoo, et al.
Pubblicazione: (2024)
di: Heo, Jaewoo, et al.
Pubblicazione: (2024)
CATFace: Cross-Attribute-Guided Transformer with Self-Attention Distillation for Low-Quality Face Recognition
di: Talemi, Niloufar Alipour, et al.
Pubblicazione: (2024)
di: Talemi, Niloufar Alipour, et al.
Pubblicazione: (2024)
Lung Infection Severity Prediction Using Transformers with Conditional TransMix Augmentation and Cross-Attention
di: Slika, Bouthaina, et al.
Pubblicazione: (2025)
di: Slika, Bouthaina, et al.
Pubblicazione: (2025)
Dual Cross-Attention Siamese Transformer for Rectal Tumor Regrowth Assessment in Watch-and-Wait Endoscopy
di: Gomez, Jorge Tapias, et al.
Pubblicazione: (2025)
di: Gomez, Jorge Tapias, et al.
Pubblicazione: (2025)
Bi-directional Contextual Attention for 3D Dense Captioning
di: Kim, Minjung, et al.
Pubblicazione: (2024)
di: Kim, Minjung, et al.
Pubblicazione: (2024)
Cross-Attention is Not Always Needed: Dynamic Cross-Attention for Audio-Visual Dimensional Emotion Recognition
di: Praveen, R. Gnana, et al.
Pubblicazione: (2024)
di: Praveen, R. Gnana, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Improving Denoising Diffusion Models via Simultaneous Estimation of Image and Noise
di: Zhang, Zhenkai, et al.
Pubblicazione: (2023) -
Sequential Amodal Segmentation via Cumulative Occlusion Learning
di: Ao, Jiayang, et al.
Pubblicazione: (2024) -
Open-World Amodal Appearance Completion
di: Ao, Jiayang, et al.
Pubblicazione: (2024) -
KALE: An Artwork Image Captioning System Augmented with Heterogeneous Graph
di: Jiang, Yanbei, et al.
Pubblicazione: (2024) -
PROPA: Toward Process-level Optimization in Visual Reasoning via Reinforcement Learning
di: Jiang, Yanbei, et al.
Pubblicazione: (2025)