Top-Down Framework for Weakly-supervised Grounded Image Captioning
Fuente:
arXiv
Guardado en:
| Autores principales: | Cai, Chen, Wang, Suchen, Yap, Kim-hui, Wang, Yi |
|---|---|
| Formato: | Preprint |
| Publicado: |
2023
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
HOI-aware Adaptive Network for Weakly-supervised Action Segmentation
por: Zhang, Runzhong, et al.
Publicado: (2026)
por: Zhang, Runzhong, et al.
Publicado: (2026)
Top-Down Semantic Refinement for Image Captioning
por: Zhang, Jusheng, et al.
Publicado: (2025)
por: Zhang, Jusheng, et al.
Publicado: (2025)
Joint Top-Down and Bottom-Up Frameworks for 3D Visual Grounding
por: Liu, Yang, et al.
Publicado: (2024)
por: Liu, Yang, et al.
Publicado: (2024)
Weakly-supervised Camera Localization by Ground-to-satellite Image Registration
por: Shi, Yujiao, et al.
Publicado: (2024)
por: Shi, Yujiao, et al.
Publicado: (2024)
Closed-Loop Transfer for Weakly-supervised Affordance Grounding
por: Tang, Jiajin, et al.
Publicado: (2025)
por: Tang, Jiajin, et al.
Publicado: (2025)
Language-driven Description Generation and Common Sense Reasoning for Video Action Recognition
por: Hu, Xiaodan, et al.
Publicado: (2025)
por: Hu, Xiaodan, et al.
Publicado: (2025)
TD-RD: A Top-Down Benchmark with Real-Time Framework for Road Damage Detection
por: Xiao, Xi, et al.
Publicado: (2025)
por: Xiao, Xi, et al.
Publicado: (2025)
Rethinking Layered Graphic Design Generation with a Top-Down Approach
por: Chen, Jingye, et al.
Publicado: (2025)
por: Chen, Jingye, et al.
Publicado: (2025)
Weakly-supervised Part-Attention and Mentored Networks for Vehicle Re-Identification
por: Tang, Lisha, et al.
Publicado: (2021)
por: Tang, Lisha, et al.
Publicado: (2021)
Towards Top-Down Reasoning: An Explainable Multi-Agent Approach for Visual Question Answering
por: Wang, Zeqing, et al.
Publicado: (2023)
por: Wang, Zeqing, et al.
Publicado: (2023)
TubeRMC: Tube-conditioned Reconstruction with Mutual Constraints for Weakly-supervised Spatio-Temporal Video Grounding
por: Li, Jinxuan, et al.
Publicado: (2025)
por: Li, Jinxuan, et al.
Publicado: (2025)
PromptSR: Cascade Prompting for Lightweight Image Super-Resolution
por: Liu, Wenyang, et al.
Publicado: (2025)
por: Liu, Wenyang, et al.
Publicado: (2025)
Decoupled Competitive Framework for Semi-supervised Medical Image Segmentation
por: Chen, Jiahe, et al.
Publicado: (2025)
por: Chen, Jiahe, et al.
Publicado: (2025)
Distinctive Image Captioning: Leveraging Ground Truth Captions in CLIP Guided Reinforcement Learning
por: Chaffin, Antoine, et al.
Publicado: (2024)
por: Chaffin, Antoine, et al.
Publicado: (2024)
A Structure-aware and Motion-adaptive Framework for 3D Human Pose Estimation with Mamba
por: Lu, Ye, et al.
Publicado: (2025)
por: Lu, Ye, et al.
Publicado: (2025)
Grounded Video Caption Generation
por: Kazakos, Evangelos, et al.
Publicado: (2024)
por: Kazakos, Evangelos, et al.
Publicado: (2024)
CaptionSmiths: Flexibly Controlling Language Pattern in Image Captioning
por: Saito, Kuniaki, et al.
Publicado: (2025)
por: Saito, Kuniaki, et al.
Publicado: (2025)
A Dual-branch Self-supervised Representation Learning Framework for Tumour Segmentation in Whole Slide Images
por: Wang, Hao, et al.
Publicado: (2023)
por: Wang, Hao, et al.
Publicado: (2023)
Embodied Image Captioning: Self-supervised Learning Agents for Spatially Coherent Image Descriptions
por: Galliena, Tommaso, et al.
Publicado: (2025)
por: Galliena, Tommaso, et al.
Publicado: (2025)
Dense Supervision Propagation for Weakly Supervised Semantic Segmentation on 3D Point Clouds
por: Wei, Jiacheng, et al.
Publicado: (2021)
por: Wei, Jiacheng, et al.
Publicado: (2021)
Convex Combination Consistency between Neighbors for Weakly-supervised Action Localization
por: Liu, Qinying, et al.
Publicado: (2022)
por: Liu, Qinying, et al.
Publicado: (2022)
Mixture-of-Modality-Experts with Holistic Token Learning for Fine-Grained Multimodal Visual Analytics in Driver Action Recognition
por: Liu, Tianyi, et al.
Publicado: (2026)
por: Liu, Tianyi, et al.
Publicado: (2026)
Rethinking Weakly-supervised Video Temporal Grounding From a Game Perspective
por: Fang, Xiang, et al.
Publicado: (2026)
por: Fang, Xiang, et al.
Publicado: (2026)
CmFNet: Cross-modal Fusion Network for Weakly-supervised Segmentation of Medical Images
por: Meng, Dongdong, et al.
Publicado: (2025)
por: Meng, Dongdong, et al.
Publicado: (2025)
A Bayesian Approach to Weakly-supervised Laparoscopic Image Segmentation
por: Zheng, Zhou, et al.
Publicado: (2024)
por: Zheng, Zhou, et al.
Publicado: (2024)
Top2Pano: Learning to Generate Indoor Panoramas from Top-Down View
por: Zhang, Zitong, et al.
Publicado: (2025)
por: Zhang, Zitong, et al.
Publicado: (2025)
SAIL: Similarity-Aware Guidance and Inter-Caption Augmentation-based Learning for Weakly-Supervised Dense Video Captioning
por: Kim, Ye-Chan, et al.
Publicado: (2026)
por: Kim, Ye-Chan, et al.
Publicado: (2026)
Exploiting Auxiliary Caption for Video Grounding
por: Li, Hongxiang, et al.
Publicado: (2023)
por: Li, Hongxiang, et al.
Publicado: (2023)
CIC: A Framework for Culturally-Aware Image Captioning
por: Yun, Youngsik, et al.
Publicado: (2024)
por: Yun, Youngsik, et al.
Publicado: (2024)
WeakTr: Exploring Plain Vision Transformer for Weakly-supervised Semantic Segmentation
por: Zhu, Lianghui, et al.
Publicado: (2023)
por: Zhu, Lianghui, et al.
Publicado: (2023)
Top-Down Guidance for Learning Object-Centric Representations
por: Zou, Junhong, et al.
Publicado: (2024)
por: Zou, Junhong, et al.
Publicado: (2024)
DEVICE: Depth and Visual Concepts Aware Transformer for OCR-based Image Captioning
por: Xu, Dongsheng, et al.
Publicado: (2023)
por: Xu, Dongsheng, et al.
Publicado: (2023)
Weakly Semi-supervised Whole Slide Image Classification by Two-level Cross Consistency Supervision
por: Qu, Linhao, et al.
Publicado: (2025)
por: Qu, Linhao, et al.
Publicado: (2025)
Top-Down Compression: Revisit Efficient Vision Token Projection for Visual Instruction Tuning
por: li, Bonan, et al.
Publicado: (2025)
por: li, Bonan, et al.
Publicado: (2025)
Leveraging Bottom-Up and Top-Down Attention for Few-Shot Object Detection
por: Chen, Xianyu, et al.
Publicado: (2020)
por: Chen, Xianyu, et al.
Publicado: (2020)
TdAttenMix: Top-Down Attention Guided Mixup
por: Wang, Zhiming, et al.
Publicado: (2025)
por: Wang, Zhiming, et al.
Publicado: (2025)
Discovering Meaningful Units with Visually Grounded Semantics from Image Captions
por: Behjati, Melika, et al.
Publicado: (2025)
por: Behjati, Melika, et al.
Publicado: (2025)
Knowledge-guided Causal Intervention for Weakly-supervised Object Localization
por: Shao, Feifei, et al.
Publicado: (2023)
por: Shao, Feifei, et al.
Publicado: (2023)
MeaCap: Memory-Augmented Zero-shot Image Captioning
por: Zeng, Zequn, et al.
Publicado: (2024)
por: Zeng, Zequn, et al.
Publicado: (2024)
ITIScore: An Image-to-Text-to-Image Rating Framework for the Image Captioning Ability of MLLMs
por: Xu, Zitong, et al.
Publicado: (2026)
por: Xu, Zitong, et al.
Publicado: (2026)
Ejemplares similares
-
HOI-aware Adaptive Network for Weakly-supervised Action Segmentation
por: Zhang, Runzhong, et al.
Publicado: (2026) -
Top-Down Semantic Refinement for Image Captioning
por: Zhang, Jusheng, et al.
Publicado: (2025) -
Joint Top-Down and Bottom-Up Frameworks for 3D Visual Grounding
por: Liu, Yang, et al.
Publicado: (2024) -
Weakly-supervised Camera Localization by Ground-to-satellite Image Registration
por: Shi, Yujiao, et al.
Publicado: (2024) -
Closed-Loop Transfer for Weakly-supervised Affordance Grounding
por: Tang, Jiajin, et al.
Publicado: (2025)