ScenarioCLIP: Pretrained Transferable Visual Language Models and Action-Genome Dataset for Natural Scene Analysis
Fuente:
arXiv
Saved in:
| Main Authors: | Sinha, Advik, Atreya, Saurabh, A V, Aashutosh, Ali, Sk Aziz, Das, Abhijit |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
DensePercept-NCSSD: Vision Mamba towards Real-time Dense Visual Perception with Non-Causal State Space Duality
by: Anand, Tushar, et al.
Published: (2025)
by: Anand, Tushar, et al.
Published: (2025)
Enhancing 3D-Air Signature by Pen Tip Tail Trajectory Awareness: Dataset and Featuring by Novel Spatio-temporal CNN
by: Atreya, Saurabh, et al.
Published: (2024)
by: Atreya, Saurabh, et al.
Published: (2024)
Narrating For You: Prompt-guided Audio-visual Narrating Face Generation Employing Multi-entangled Latent Space
by: Chandra, Aashish, et al.
Published: (2026)
by: Chandra, Aashish, et al.
Published: (2026)
KDC-MAE: Knowledge Distilled Contrastive Mask Auto-Encoder
by: Bora, Maheswar, et al.
Published: (2024)
by: Bora, Maheswar, et al.
Published: (2024)
Beyond Real versus Fake Towards Intent-Aware Video Analysis
by: Atreya, Saurabh, et al.
Published: (2025)
by: Atreya, Saurabh, et al.
Published: (2025)
ViM-Disparity: Bridging the Gap of Speed, Accuracy and Memory for Disparity Map Generation
by: Bora, Maheswar, et al.
Published: (2024)
by: Bora, Maheswar, et al.
Published: (2024)
Towards Obstacle-Avoiding Control of Planar Snake Robots Exploring Neuro-Evolution of Augmenting Topologies
by: Sinha, Advik, et al.
Published: (2025)
by: Sinha, Advik, et al.
Published: (2025)
CLIP-RL: Surgical Scene Segmentation Using Contrastive Language-Vision Pretraining & Reinforcement Learning
by: Ahmed, Fatmaelzahraa Ali, et al.
Published: (2025)
by: Ahmed, Fatmaelzahraa Ali, et al.
Published: (2025)
4D-VLA: Spatiotemporal Vision-Language-Action Pretraining with Cross-Scene Calibration
by: Zhang, Jiahui, et al.
Published: (2025)
by: Zhang, Jiahui, et al.
Published: (2025)
Scenario Understanding of Traffic Scenes Through Large Visual Language Models
by: Rivera, Esteban, et al.
Published: (2025)
by: Rivera, Esteban, et al.
Published: (2025)
MARVEL-40M+: Multi-Level Visual Elaboration for High-Fidelity Text-to-3D Content Creation
by: Sinha, Sankalp, et al.
Published: (2024)
by: Sinha, Sankalp, et al.
Published: (2024)
InfoCLIP: Bridging Vision-Language Pretraining and Open-Vocabulary Semantic Segmentation via Information-Theoretic Alignment Transfer
by: Yuan, Muyao, et al.
Published: (2025)
by: Yuan, Muyao, et al.
Published: (2025)
RankCLIP: Ranking-Consistent Language-Image Pretraining
by: Zhang, Yiming, et al.
Published: (2024)
by: Zhang, Yiming, et al.
Published: (2024)
Prompt Tuning for CLIP on the Pretrained Manifold
by: Yang, Xi, et al.
Published: (2026)
by: Yang, Xi, et al.
Published: (2026)
CLIP-Mamba: CLIP Pretrained Mamba Models with OOD and Hessian Evaluation
by: Huang, Weiquan, et al.
Published: (2024)
by: Huang, Weiquan, et al.
Published: (2024)
LA-Pose: Latent Action Pretraining Meets Pose Estimation
by: Wang, Zhengqing, et al.
Published: (2026)
by: Wang, Zhengqing, et al.
Published: (2026)
AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis
by: Alawode, Basit, et al.
Published: (2025)
by: Alawode, Basit, et al.
Published: (2025)
EV-CLIP: Efficient Visual Prompt Adaptation for CLIP in Few-shot Action Recognition under Visual Challenges
by: Jon, Hyo Jin, et al.
Published: (2026)
by: Jon, Hyo Jin, et al.
Published: (2026)
BRep Boundary and Junction Detection for CAD Reverse Engineering
by: Ali, Sk Aziz, et al.
Published: (2024)
by: Ali, Sk Aziz, et al.
Published: (2024)
MMIS: Multimodal Dataset for Interior Scene Visual Generation and Recognition
by: Kassab, Hozaifa, et al.
Published: (2024)
by: Kassab, Hozaifa, et al.
Published: (2024)
CLIP-AE: CLIP-assisted Cross-view Audio-Visual Enhancement for Unsupervised Temporal Action Localization
by: Xia, Rui, et al.
Published: (2025)
by: Xia, Rui, et al.
Published: (2025)
A Backbone Benchmarking Study on Self-supervised Learning as a Auxiliary Task with Texture-based Local Descriptors for Face Analysis
by: Reddy, Shukesh, et al.
Published: (2026)
by: Reddy, Shukesh, et al.
Published: (2026)
Dataset and Benchmark for Urdu Natural Scenes Text Detection, Recognition and Visual Question Answering
by: Maryam, Hiba, et al.
Published: (2024)
by: Maryam, Hiba, et al.
Published: (2024)
Investigating and Mitigating Object Hallucinations in Pretrained Vision-Language (CLIP) Models
by: Liu, Yufang, et al.
Published: (2024)
by: Liu, Yufang, et al.
Published: (2024)
MAD: Microenvironment-Aware Distillation -- A Pretraining Strategy for Virtual Spatial Omics from Microscopy
by: Han, Jiashu, et al.
Published: (2026)
by: Han, Jiashu, et al.
Published: (2026)
Text2CAD: Generating Sequential CAD Models from Beginner-to-Expert Level Text Prompts
by: Khan, Mohammad Sadil, et al.
Published: (2024)
by: Khan, Mohammad Sadil, et al.
Published: (2024)
SceneSplat: Gaussian Splatting-based Scene Understanding with Vision-Language Pretraining
by: Li, Yue, et al.
Published: (2025)
by: Li, Yue, et al.
Published: (2025)
Latent Action Pretraining Through World Modeling
by: Tharwat, Bahey, et al.
Published: (2025)
by: Tharwat, Bahey, et al.
Published: (2025)
OphCLIP: Hierarchical Retrieval-Augmented Learning for Ophthalmic Surgical Video-Language Pretraining
by: Hu, Ming, et al.
Published: (2024)
by: Hu, Ming, et al.
Published: (2024)
MAM-CLIP: Vision-Language Pretraining on Mammography Atlases for BI-RADS Classification
by: Gulluk, Halil Ibrahim, et al.
Published: (2026)
by: Gulluk, Halil Ibrahim, et al.
Published: (2026)
CAD-SIGNet: CAD Language Inference from Point Clouds using Layer-wise Sketch Instance Guided Attention
by: Khan, Mohammad Sadil, et al.
Published: (2024)
by: Khan, Mohammad Sadil, et al.
Published: (2024)
GASP: Efficient Black-Box Generation of Adversarial Suffixes for Jailbreaking LLMs
by: Basani, Advik Raj, et al.
Published: (2024)
by: Basani, Advik Raj, et al.
Published: (2024)
Towards Student Actions in Classroom Scenes: New Dataset and Baseline
by: Tan, Zhuolin, et al.
Published: (2024)
by: Tan, Zhuolin, et al.
Published: (2024)
GoldiCLIP: The Goldilocks Approach for Balancing Explicit Supervision for Language-Image Pretraining
by: Mohan, Deen Dayal, et al.
Published: (2026)
by: Mohan, Deen Dayal, et al.
Published: (2026)
QwenCLIP: Boosting Medical Vision-Language Pretraining via LLM Embeddings and Prompt tuning
by: Wei, Xiaoyang, et al.
Published: (2025)
by: Wei, Xiaoyang, et al.
Published: (2025)
Color in Visual-Language Models: CLIP deficiencies
by: Arias, Guillem, et al.
Published: (2025)
by: Arias, Guillem, et al.
Published: (2025)
Self-supervised Auxiliary Learning for Texture and Model-based Hybrid Robust and Fair Featuring in Face Analysis
by: Reddy, Shukesh, et al.
Published: (2024)
by: Reddy, Shukesh, et al.
Published: (2024)
Image Synthesis with Graph Conditioning: CLIP-Guided Diffusion Models for Scene Graphs
by: Mishra, Rameshwar, et al.
Published: (2024)
by: Mishra, Rameshwar, et al.
Published: (2024)
Extreme Model Compression for Edge Vision-Language Models: Sparse Temporal Token Fusion and Adaptive Neural Compression
by: Tanvir, Md Tasnin, et al.
Published: (2025)
by: Tanvir, Md Tasnin, et al.
Published: (2025)
Robotic-CLIP: Fine-tuning CLIP on Action Data for Robotic Applications
by: Nguyen, Nghia, et al.
Published: (2024)
by: Nguyen, Nghia, et al.
Published: (2024)
Similar Items
-
DensePercept-NCSSD: Vision Mamba towards Real-time Dense Visual Perception with Non-Causal State Space Duality
by: Anand, Tushar, et al.
Published: (2025) -
Enhancing 3D-Air Signature by Pen Tip Tail Trajectory Awareness: Dataset and Featuring by Novel Spatio-temporal CNN
by: Atreya, Saurabh, et al.
Published: (2024) -
Narrating For You: Prompt-guided Audio-visual Narrating Face Generation Employing Multi-entangled Latent Space
by: Chandra, Aashish, et al.
Published: (2026) -
KDC-MAE: Knowledge Distilled Contrastive Mask Auto-Encoder
by: Bora, Maheswar, et al.
Published: (2024) -
Beyond Real versus Fake Towards Intent-Aware Video Analysis
by: Atreya, Saurabh, et al.
Published: (2025)