Dual-Stream Collaborative Transformer for Image Captioning
Fuente:
arXiv
Saved in:
| Main Authors: | Wan, Jun, Liu, Jun, lai, Zhihui, Zhou, Jie |
|---|---|
| Format: | Preprint |
| Published: |
2026
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
FGTBT: Frequency-Guided Task-Balancing Transformer for Unified Facial Landmark Detection
by: Wan, Jun, et al.
Published: (2026)
by: Wan, Jun, et al.
Published: (2026)
Precise Facial Landmark Detection by Dynamic Semantic Aggregation Transformer
by: Wan, Jun, et al.
Published: (2024)
by: Wan, Jun, et al.
Published: (2024)
Streaming Dense Video Captioning
by: Zhou, Xingyi, et al.
Published: (2024)
by: Zhou, Xingyi, et al.
Published: (2024)
Improving Text Generation on Images with Synthetic Captions
by: Koh, Jun Young, et al.
Published: (2024)
by: Koh, Jun Young, et al.
Published: (2024)
Dual-path Collaborative Generation Network for Emotional Video Captioning
by: Ye, Cheng, et al.
Published: (2024)
by: Ye, Cheng, et al.
Published: (2024)
StreamSTGS: Streaming Spatial and Temporal Gaussian Grids for Real-Time Free-Viewpoint Video
by: Ke, Zhihui, et al.
Published: (2025)
by: Ke, Zhihui, et al.
Published: (2025)
Supervision-by-Hallucination-and-Transfer: A Weakly-Supervised Approach for Robust and Precise Facial Landmark Detection
by: Wan, Jun, et al.
Published: (2026)
by: Wan, Jun, et al.
Published: (2026)
4DSegStreamer: Streaming 4D Panoptic Segmentation via Dual Threads
by: Liu, Ling, et al.
Published: (2025)
by: Liu, Ling, et al.
Published: (2025)
Harnessing Caption Detailness for Data-Efficient Text-to-Image Generation
by: Wang, Xinran, et al.
Published: (2025)
by: Wang, Xinran, et al.
Published: (2025)
CaptionQA: Is Your Caption as Useful as the Image Itself?
by: Yang, Shijia, et al.
Published: (2025)
by: Yang, Shijia, et al.
Published: (2025)
Shifted Window Fourier Transform And Retention For Image Captioning
by: Hu, Jia Cheng, et al.
Published: (2024)
by: Hu, Jia Cheng, et al.
Published: (2024)
Embedded Heterogeneous Attention Transformer for Cross-lingual Image Captioning
by: Song, Zijie, et al.
Published: (2023)
by: Song, Zijie, et al.
Published: (2023)
Multi-LLM Collaborative Caption Generation in Scientific Documents
by: Kim, Jaeyoung, et al.
Published: (2025)
by: Kim, Jaeyoung, et al.
Published: (2025)
UIT-DarkCow team at ImageCLEFmedical Caption 2024: Diagnostic Captioning for Radiology Images Efficiency with Transformer Models
by: Van Nguyen, Quan, et al.
Published: (2024)
by: Van Nguyen, Quan, et al.
Published: (2024)
A Lightweight Sparse Focus Transformer for Remote Sensing Image Change Captioning
by: Sun, Dongwei, et al.
Published: (2024)
by: Sun, Dongwei, et al.
Published: (2024)
Dual-Scale Volume Priors with Wasserstein-Based Consistency for Semi-Supervised Medical Image Segmentation
by: Meng, Junying, et al.
Published: (2025)
by: Meng, Junying, et al.
Published: (2025)
SGDiff: Scene Graph Guided Diffusion Model for Image Collaborative SegCaptioning
by: Zhang, Xu, et al.
Published: (2025)
by: Zhang, Xu, et al.
Published: (2025)
Automated Image Captioning with CNNs and Transformers
by: Cahyono, Joshua Adrian, et al.
Published: (2024)
by: Cahyono, Joshua Adrian, et al.
Published: (2024)
Hierarchical Dual-Change Collaborative Learning for UAV Scene Change Captioning
by: Chen, Fuhai, et al.
Published: (2026)
by: Chen, Fuhai, et al.
Published: (2026)
NCL++: Nested Collaborative Learning for Long-Tailed Visual Recognition
by: Tan, Zichang, et al.
Published: (2023)
by: Tan, Zichang, et al.
Published: (2023)
RetinexDualV2: Physically-Grounded Dual Retinex for Generalized UHD Image Restoration
by: Kishawy, Mohab, et al.
Published: (2026)
by: Kishawy, Mohab, et al.
Published: (2026)
Semi-Supervised Dual-Threshold Contrastive Learning for Ultrasound Image Classification and Segmentation
by: Zhang, Peng, et al.
Published: (2025)
by: Zhang, Peng, et al.
Published: (2025)
DA-HFNet: Progressive Fine-Grained Forgery Image Detection and Localization Based on Dual Attention
by: Liu, Yang, et al.
Published: (2024)
by: Liu, Yang, et al.
Published: (2024)
SFD-Mamba2Net: Structure-Guided Frequency-Enhanced Dual-Stream Mamba2 Network for Coronary Artery Segmentation
by: Mu, Nan, et al.
Published: (2025)
by: Mu, Nan, et al.
Published: (2025)
Evaluating Remote Sensing Image Captions Beyond Metric Biases
by: Chen, Ziyun, et al.
Published: (2026)
by: Chen, Ziyun, et al.
Published: (2026)
Transformer based Multitask Learning for Image Captioning and Object Detection
by: Basak, Debolena, et al.
Published: (2024)
by: Basak, Debolena, et al.
Published: (2024)
Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer
by: Image Team, et al.
Published: (2025)
by: Image Team, et al.
Published: (2025)
Fully Differentiable Bidirectional Dual-Task Synergistic Learning for Semi-Supervised 3D Medical Image Segmentation
by: Li, Jun
Published: (2026)
by: Li, Jun
Published: (2026)
Image Captioning via Compact Bidirectional Architecture
by: Song, Zijie, et al.
Published: (2022)
by: Song, Zijie, et al.
Published: (2022)
CaptionSmiths: Flexibly Controlling Language Pattern in Image Captioning
by: Saito, Kuniaki, et al.
Published: (2025)
by: Saito, Kuniaki, et al.
Published: (2025)
Analyzing Transformer Models and Knowledge Distillation Approaches for Image Captioning on Edge AI
by: Kwok, Wing Man Casca, et al.
Published: (2025)
by: Kwok, Wing Man Casca, et al.
Published: (2025)
DEVICE: Depth and Visual Concepts Aware Transformer for OCR-based Image Captioning
by: Xu, Dongsheng, et al.
Published: (2023)
by: Xu, Dongsheng, et al.
Published: (2023)
Image Captioning via Dynamic Path Customization
by: Ma, Yiwei, et al.
Published: (2024)
by: Ma, Yiwei, et al.
Published: (2024)
AeroLite: Tag-Guided Lightweight Generation of Aerial Image Captions
by: Zi, Xing, et al.
Published: (2025)
by: Zi, Xing, et al.
Published: (2025)
Dual Caption Preference Optimization for Diffusion Models
by: Saeidi, Amir, et al.
Published: (2025)
by: Saeidi, Amir, et al.
Published: (2025)
Benchmarking Large Vision-Language Models via Directed Scene Graph for Comprehensive Image Captioning
by: Lu, Fan, et al.
Published: (2024)
by: Lu, Fan, et al.
Published: (2024)
Scene Graph-guided SegCaptioning Transformer with Fine-grained Alignment for Controllable Video Segmentation and Captioning
by: Zhang, Xu, et al.
Published: (2026)
by: Zhang, Xu, et al.
Published: (2026)
BeNeRF: Neural Radiance Fields from a Single Blurry Image and Event Stream
by: Li, Wenpu, et al.
Published: (2024)
by: Li, Wenpu, et al.
Published: (2024)
DSAGL: Dual-Stream Attention-Guided Learning for Weakly Supervised Whole Slide Image Classification
by: Cao, Daoxi, et al.
Published: (2025)
by: Cao, Daoxi, et al.
Published: (2025)
SC-Captioner: Improving Image Captioning with Self-Correction by Reinforcement Learning
by: Zhang, Lin, et al.
Published: (2025)
by: Zhang, Lin, et al.
Published: (2025)
Similar Items
-
FGTBT: Frequency-Guided Task-Balancing Transformer for Unified Facial Landmark Detection
by: Wan, Jun, et al.
Published: (2026) -
Precise Facial Landmark Detection by Dynamic Semantic Aggregation Transformer
by: Wan, Jun, et al.
Published: (2024) -
Streaming Dense Video Captioning
by: Zhou, Xingyi, et al.
Published: (2024) -
Improving Text Generation on Images with Synthetic Captions
by: Koh, Jun Young, et al.
Published: (2024) -
Dual-path Collaborative Generation Network for Emotional Video Captioning
by: Ye, Cheng, et al.
Published: (2024)