A Hybrid Deterministic Framework for Named Entity Extraction in Broadcast News Video
Fuente:
arXiv
Salvato in:
| Autori principali: | Lucas, Andrea Filiberto, Seychell, Dylan |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
CLIP-Joint-Detect: End-to-End Joint Training of Object Detectors with Contrastive Vision-Language Supervision
di: Raoufi, Behnam, et al.
Pubblicazione: (2025)
di: Raoufi, Behnam, et al.
Pubblicazione: (2025)
Action Anticipation from SoccerNet Football Video Broadcasts
di: Dalal, Mohamad, et al.
Pubblicazione: (2025)
di: Dalal, Mohamad, et al.
Pubblicazione: (2025)
Light Future: Multimodal Action Frame Prediction via InstructPix2Pix
di: Zhong, Zesen, et al.
Pubblicazione: (2025)
di: Zhong, Zesen, et al.
Pubblicazione: (2025)
Scene Detection Policies and Keyframe Extraction Strategies for Large-Scale Video Analysis
di: Korolkov, Vasilii
Pubblicazione: (2025)
di: Korolkov, Vasilii
Pubblicazione: (2025)
PhysVideoGenerator: Towards Physically Aware Video Generation via Latent Physics Guidance
di: Satish, Siddarth Nilol Kundur, et al.
Pubblicazione: (2026)
di: Satish, Siddarth Nilol Kundur, et al.
Pubblicazione: (2026)
Fashion Florence: Fine-Tuning Florence-2 for Structured Fashion Attribute Extraction
di: Berlia, Anushree
Pubblicazione: (2026)
di: Berlia, Anushree
Pubblicazione: (2026)
A Simple Baseline for Streaming Video Understanding
di: Shen, Yujiao, et al.
Pubblicazione: (2026)
di: Shen, Yujiao, et al.
Pubblicazione: (2026)
NOAH: Benchmarking Narrative Prior driven Hallucination and Omission in Video Large Language Models
di: Lee, Kyuho, et al.
Pubblicazione: (2025)
di: Lee, Kyuho, et al.
Pubblicazione: (2025)
Leum-VL Technical Report
di: He, Yuxuan, et al.
Pubblicazione: (2026)
di: He, Yuxuan, et al.
Pubblicazione: (2026)
CausalVQA: A Physically Grounded Causal Reasoning Benchmark for Video Models
di: Foss, Aaron, et al.
Pubblicazione: (2025)
di: Foss, Aaron, et al.
Pubblicazione: (2025)
Car Object Counting and Position Estimation via Extension of the CLIP-EBC Framework
di: Jung, Seoik, et al.
Pubblicazione: (2025)
di: Jung, Seoik, et al.
Pubblicazione: (2025)
Vi-SAFE: A Spatial-Temporal Framework for Efficient Violence Detection in Public Surveillance
di: Chang, Ligang, et al.
Pubblicazione: (2025)
di: Chang, Ligang, et al.
Pubblicazione: (2025)
A Reverse Causal Framework to Mitigate Spurious Correlations for Debiasing Scene Graph Generation
di: Sun, Shuzhou, et al.
Pubblicazione: (2025)
di: Sun, Shuzhou, et al.
Pubblicazione: (2025)
Automated Plant Disease and Pest Detection System Using Hybrid Lightweight CNN-MobileViT Models for Diagnosis of Indigenous Crops
di: Gebremedhin, Tekleab G., et al.
Pubblicazione: (2025)
di: Gebremedhin, Tekleab G., et al.
Pubblicazione: (2025)
Automatic Detection of Intro and Credits in Video using CLIP and Multihead Attention
di: Korolkov, Vasilii, et al.
Pubblicazione: (2025)
di: Korolkov, Vasilii, et al.
Pubblicazione: (2025)
A Two-Stage, Object-Centric Deep Learning Framework for Robust Exam Cheating Detection
di: Le, Van-Truong, et al.
Pubblicazione: (2026)
di: Le, Van-Truong, et al.
Pubblicazione: (2026)
Mistake Attribution: Fine-Grained Mistake Understanding in Egocentric Videos
di: Li, Yayuan, et al.
Pubblicazione: (2025)
di: Li, Yayuan, et al.
Pubblicazione: (2025)
Motion-Guided Semantic Alignment with Negative Prompts for Zero-Shot Video Action Recognition
di: Wang, Yiming, et al.
Pubblicazione: (2026)
di: Wang, Yiming, et al.
Pubblicazione: (2026)
HY-Himmel Technical Report: Hierarchical Interleaved Multi-stream Motion Encoding for Long Video Understanding
di: Jin, Haopeng, et al.
Pubblicazione: (2026)
di: Jin, Haopeng, et al.
Pubblicazione: (2026)
Context in object detection: a systematic literature review
di: Jamali, Mahtab, et al.
Pubblicazione: (2025)
di: Jamali, Mahtab, et al.
Pubblicazione: (2025)
Mask-Conditioned Voxel Diffusion for Joint Geometry and Color Inpainting
di: Sumuk, Aarya
Pubblicazione: (2026)
di: Sumuk, Aarya
Pubblicazione: (2026)
Pedestrian Detection in Low-Light Conditions: A Comprehensive Survey
di: Ghari, Bahareh, et al.
Pubblicazione: (2024)
di: Ghari, Bahareh, et al.
Pubblicazione: (2024)
FlowIBR: Leveraging Pre-Training for Efficient Neural Image-Based Rendering of Dynamic Scenes
di: Büsching, Marcel, et al.
Pubblicazione: (2023)
di: Büsching, Marcel, et al.
Pubblicazione: (2023)
IMASHRIMP: Automatic White Shrimp (Penaeus vannamei) Biometrical Analysis from Laboratory Images Using Computer Vision and Deep Learning
di: González, Abiam Remache, et al.
Pubblicazione: (2025)
di: González, Abiam Remache, et al.
Pubblicazione: (2025)
OCC-MLLM-CoT-Alpha: Towards Multi-stage Occlusion Recognition Based on Large Language Models via 3D-Aware Supervision and Chain-of-Thoughts Guidance
di: Wang, Chaoyi, et al.
Pubblicazione: (2025)
di: Wang, Chaoyi, et al.
Pubblicazione: (2025)
Reducing Object Hallucination in LVLMs via Emphasizing Image-negative Tokens
di: Shen, Meng, et al.
Pubblicazione: (2026)
di: Shen, Meng, et al.
Pubblicazione: (2026)
Towards a Generalizable Fusion Architecture for Multimodal Object Detection
di: Berjawi, Jad, et al.
Pubblicazione: (2025)
di: Berjawi, Jad, et al.
Pubblicazione: (2025)
EmoVerse: A MLLMs-Driven Emotion Representation Dataset for Interpretable Visual Emotion Analysis
di: Guo, Yijie, et al.
Pubblicazione: (2025)
di: Guo, Yijie, et al.
Pubblicazione: (2025)
SimWorld: A Unified Benchmark for Simulator-Conditioned Scene Generation via World Model
di: Li, Xinqing, et al.
Pubblicazione: (2025)
di: Li, Xinqing, et al.
Pubblicazione: (2025)
SCA-Net: Spatial-Contextual Aggregation Network for Enhanced Small Building and Road Change Detection
di: Gholibeigi, Emad, et al.
Pubblicazione: (2026)
di: Gholibeigi, Emad, et al.
Pubblicazione: (2026)
Synthetic-Child: An AIGC-Based Synthetic Data Pipeline for Privacy-Preserving Child Posture Estimation
di: Zeng, Taowen
Pubblicazione: (2026)
di: Zeng, Taowen
Pubblicazione: (2026)
Exploring Surround-View Fisheye Camera 3D Object Detection
di: Li, Changcai, et al.
Pubblicazione: (2025)
di: Li, Changcai, et al.
Pubblicazione: (2025)
A Vision-Language Model for Focal Liver Lesion Classification
di: Jian, Song, et al.
Pubblicazione: (2025)
di: Jian, Song, et al.
Pubblicazione: (2025)
Pixel-Level Pavement Distress Assessment Using Instance Segmentation
di: Dewick, Logan, et al.
Pubblicazione: (2026)
di: Dewick, Logan, et al.
Pubblicazione: (2026)
A Recipe for Geometry-Aware 3D Mesh Transformers
di: Farazi, Mohammad, et al.
Pubblicazione: (2024)
di: Farazi, Mohammad, et al.
Pubblicazione: (2024)
Video-based Exercise Classification and Activated Muscle Group Prediction with Hybrid X3D-SlowFast Network
di: Pasula, Manvik, et al.
Pubblicazione: (2024)
di: Pasula, Manvik, et al.
Pubblicazione: (2024)
Semantic2Graph: Graph-based Multi-modal Feature Fusion for Action Segmentation in Videos
di: Zhang, Junbin, et al.
Pubblicazione: (2022)
di: Zhang, Junbin, et al.
Pubblicazione: (2022)
Interpretable Tau-PET Synthesis from Multimodal T1-Weighted and FLAIR MRI Using Partial Information Decomposition Guided Disentangled Quantized Half-UNet
di: Chopra, Agamdeep S., et al.
Pubblicazione: (2026)
di: Chopra, Agamdeep S., et al.
Pubblicazione: (2026)
RSTeller: Scaling Up Visual Language Modeling in Remote Sensing with Rich Linguistic Semantics from Openly Available Data and Large Language Models
di: Ge, Junyao, et al.
Pubblicazione: (2024)
di: Ge, Junyao, et al.
Pubblicazione: (2024)
Application of YOLOv8 in monocular downward multiple Car Target detection
di: Lyu, Shijie
Pubblicazione: (2025)
di: Lyu, Shijie
Pubblicazione: (2025)
Documenti analoghi
-
CLIP-Joint-Detect: End-to-End Joint Training of Object Detectors with Contrastive Vision-Language Supervision
di: Raoufi, Behnam, et al.
Pubblicazione: (2025) -
Action Anticipation from SoccerNet Football Video Broadcasts
di: Dalal, Mohamad, et al.
Pubblicazione: (2025) -
Light Future: Multimodal Action Frame Prediction via InstructPix2Pix
di: Zhong, Zesen, et al.
Pubblicazione: (2025) -
Scene Detection Policies and Keyframe Extraction Strategies for Large-Scale Video Analysis
di: Korolkov, Vasilii
Pubblicazione: (2025) -
PhysVideoGenerator: Towards Physically Aware Video Generation via Latent Physics Guidance
di: Satish, Siddarth Nilol Kundur, et al.
Pubblicazione: (2026)