Video Annotator: A framework for efficiently building video classifiers using vision-language models and active learning
Fuente:
arXiv
Salvato in:
| Autori principali: | Ziai, Amir, Vartakavi, Aneesh |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Contrastive vision-language learning with paraphrasing and negation
di: Ngan, Kwun Ho, et al.
Pubblicazione: (2025)
di: Ngan, Kwun Ho, et al.
Pubblicazione: (2025)
What do vision-language models see in the context? Investigating multimodal in-context learning
di: Santos, Gabriel O. dos, et al.
Pubblicazione: (2025)
di: Santos, Gabriel O. dos, et al.
Pubblicazione: (2025)
BRAVE: Broadening the visual encoding of vision-language models
di: Kar, Oğuzhan Fatih, et al.
Pubblicazione: (2024)
di: Kar, Oğuzhan Fatih, et al.
Pubblicazione: (2024)
Look, Remember and Reason: Grounded reasoning in videos with language models
di: Bhattacharyya, Apratim, et al.
Pubblicazione: (2023)
di: Bhattacharyya, Apratim, et al.
Pubblicazione: (2023)
Amortizing intractable inference in diffusion models for vision, language, and control
di: Venkatraman, Siddarth, et al.
Pubblicazione: (2024)
di: Venkatraman, Siddarth, et al.
Pubblicazione: (2024)
Machine learning-enabled velocity model building with uncertainty quantification
di: Orozco, Rafael, et al.
Pubblicazione: (2024)
di: Orozco, Rafael, et al.
Pubblicazione: (2024)
A practical approach to evaluating the adversarial distance for machine learning classifiers
di: Siedel, Georg, et al.
Pubblicazione: (2024)
di: Siedel, Georg, et al.
Pubblicazione: (2024)
Class incremental learning with probability dampening and cascaded gated classifier
di: Pomponi, Jary, et al.
Pubblicazione: (2024)
di: Pomponi, Jary, et al.
Pubblicazione: (2024)
ViSTa Dataset: Do vision-language models understand sequential tasks?
di: Wybitul, Evžen, et al.
Pubblicazione: (2024)
di: Wybitul, Evžen, et al.
Pubblicazione: (2024)
Visual hallucination detection in large vision-language models via evidential conflict
di: Huang, Tao, et al.
Pubblicazione: (2025)
di: Huang, Tao, et al.
Pubblicazione: (2025)
FlySearch: Exploring how vision-language models explore
di: Pardyl, Adam, et al.
Pubblicazione: (2025)
di: Pardyl, Adam, et al.
Pubblicazione: (2025)
DeepDamageNet: A two-step deep-learning model for multi-disaster building damage segmentation and classification using satellite imagery
di: Alisjahbana, Irene, et al.
Pubblicazione: (2024)
di: Alisjahbana, Irene, et al.
Pubblicazione: (2024)
VISion On Request: Enhanced VLLM efficiency with sparse, dynamically selected, vision-language interactions
di: Bulat, Adrian, et al.
Pubblicazione: (2026)
di: Bulat, Adrian, et al.
Pubblicazione: (2026)
The in-context inductive biases of vision-language models differ across modalities
di: Allen, Kelsey, et al.
Pubblicazione: (2025)
di: Allen, Kelsey, et al.
Pubblicazione: (2025)
Bridging vision language model (VLM) evaluation gaps with a framework for scalable and cost-effective benchmark generation
di: Rädsch, Tim, et al.
Pubblicazione: (2025)
di: Rädsch, Tim, et al.
Pubblicazione: (2025)
A preliminary study on continual learning in computer vision using Kolmogorov-Arnold Networks
di: Cacciatore, Alessandro, et al.
Pubblicazione: (2024)
di: Cacciatore, Alessandro, et al.
Pubblicazione: (2024)
GP-VLS: A general-purpose vision language model for surgery
di: Schmidgall, Samuel, et al.
Pubblicazione: (2024)
di: Schmidgall, Samuel, et al.
Pubblicazione: (2024)
Bridging visual saliency and large language models for explainable deep learning in medical imaging
di: Nguezet, Paul Valery, et al.
Pubblicazione: (2026)
di: Nguezet, Paul Valery, et al.
Pubblicazione: (2026)
General surgery vision transformer: A video pre-trained foundation model for general surgery
di: Schmidgall, Samuel, et al.
Pubblicazione: (2024)
di: Schmidgall, Samuel, et al.
Pubblicazione: (2024)
Video alignment using unsupervised learning of local and global features
di: Fakhfour, Niloufar, et al.
Pubblicazione: (2023)
di: Fakhfour, Niloufar, et al.
Pubblicazione: (2023)
An uncertainty-aware Bayesian framework for machine learning classification models: A case study in land cover classification
di: Bilson, Samuel, et al.
Pubblicazione: (2025)
di: Bilson, Samuel, et al.
Pubblicazione: (2025)
Cross-modal linkage risk in clinical vision-language models
di: Arasteh, Soroosh Tayebi, et al.
Pubblicazione: (2026)
di: Arasteh, Soroosh Tayebi, et al.
Pubblicazione: (2026)
PathAlign: A vision-language model for whole slide images in histopathology
di: Ahmed, Faruk, et al.
Pubblicazione: (2024)
di: Ahmed, Faruk, et al.
Pubblicazione: (2024)
PooDLe: Pooled and dense self-supervised learning from naturalistic videos
di: Wang, Alex N., et al.
Pubblicazione: (2024)
di: Wang, Alex N., et al.
Pubblicazione: (2024)
A hierarchical loss and its problems when classifying non-hierarchically
di: Wu, Cinna, et al.
Pubblicazione: (2017)
di: Wu, Cinna, et al.
Pubblicazione: (2017)
Loss Knows Best: Detecting Annotation Errors in Videos via Loss Trajectories
di: Alwis, Praditha, et al.
Pubblicazione: (2026)
di: Alwis, Praditha, et al.
Pubblicazione: (2026)
Privacy-Preserving Empathy Detection in Video Interactions
di: Hasan, Md Rakibul, et al.
Pubblicazione: (2025)
di: Hasan, Md Rakibul, et al.
Pubblicazione: (2025)
Leveraging Foundation Models for Causal Generative Modeling
di: Komanduri, Aneesh, et al.
Pubblicazione: (2026)
di: Komanduri, Aneesh, et al.
Pubblicazione: (2026)
Ego-VPA: Egocentric Video Understanding with Parameter-efficient Adaptation
di: Wu, Tz-Ying, et al.
Pubblicazione: (2024)
di: Wu, Tz-Ying, et al.
Pubblicazione: (2024)
How to build the best medical image segmentation algorithm using foundation models: a comprehensive empirical study with Segment Anything Model
di: Gu, Hanxue, et al.
Pubblicazione: (2024)
di: Gu, Hanxue, et al.
Pubblicazione: (2024)
Advancing vision-language models in front-end development via data synthesis
di: Ge, Tong, et al.
Pubblicazione: (2025)
di: Ge, Tong, et al.
Pubblicazione: (2025)
Structured Output Regularization: a framework for few-shot transfer learning
di: Ewen, Nicolas, et al.
Pubblicazione: (2025)
di: Ewen, Nicolas, et al.
Pubblicazione: (2025)
Rethinking generalization of classifiers in separable classes scenarios and over-parameterized regimes
di: Martinetz, Julius, et al.
Pubblicazione: (2024)
di: Martinetz, Julius, et al.
Pubblicazione: (2024)
SoliReward: Mitigating Susceptibility to Reward Hacking and Annotation Noise in Video Generation Reward Models
di: Lian, Jiesong, et al.
Pubblicazione: (2025)
di: Lian, Jiesong, et al.
Pubblicazione: (2025)
Linking heterogeneous microstructure informatics with expert characterization knowledge through customized and hybrid vision-language representations for industrial qualification
di: Safdar, Mutahar, et al.
Pubblicazione: (2025)
di: Safdar, Mutahar, et al.
Pubblicazione: (2025)
How to build a consistency model: Learning flow maps via self-distillation
di: Boffi, Nicholas M., et al.
Pubblicazione: (2025)
di: Boffi, Nicholas M., et al.
Pubblicazione: (2025)
A comparative study on wearables and single-camera video for upper-limb out-of-thelab activity recognition with different deep learning architectures
di: Martínez-Zarzuela, Mario, et al.
Pubblicazione: (2024)
di: Martínez-Zarzuela, Mario, et al.
Pubblicazione: (2024)
An explainable vision transformer with transfer learning based efficient drought stress identification
di: Patra, Aswini Kumar, et al.
Pubblicazione: (2024)
di: Patra, Aswini Kumar, et al.
Pubblicazione: (2024)
TLG: Temporal-Logic Grounding for Video Question Answering via Source-Annotation Reconstruction and Category-Targeted Reasoning
di: Alavi, Ali
Pubblicazione: (2026)
di: Alavi, Ali
Pubblicazione: (2026)
Robust Segmentation Models using an Uncertainty Slice Sampling Based Annotation Workflow
di: Chlebus, Grzegorz, et al.
Pubblicazione: (2021)
di: Chlebus, Grzegorz, et al.
Pubblicazione: (2021)
Documenti analoghi
-
Contrastive vision-language learning with paraphrasing and negation
di: Ngan, Kwun Ho, et al.
Pubblicazione: (2025) -
What do vision-language models see in the context? Investigating multimodal in-context learning
di: Santos, Gabriel O. dos, et al.
Pubblicazione: (2025) -
BRAVE: Broadening the visual encoding of vision-language models
di: Kar, Oğuzhan Fatih, et al.
Pubblicazione: (2024) -
Look, Remember and Reason: Grounded reasoning in videos with language models
di: Bhattacharyya, Apratim, et al.
Pubblicazione: (2023) -
Amortizing intractable inference in diffusion models for vision, language, and control
di: Venkatraman, Siddarth, et al.
Pubblicazione: (2024)