VideoNet: A Large-Scale Dataset for Domain-Specific Action Recognition
Fuente:
arXiv
Salvato in:
| Autori principali: | Yadav, Tanush, Salehi, Mohammadreza, Park, Jae Sung, Ramanujan, Vivek, Hajishirzi, Hannaneh, Choi, Yejin, Farhadi, Ali, Tripathi, Rohun, Krishna, Ranjay |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
ActionAtlas: A VideoQA Benchmark for Domain-specialized Action Recognition
di: Salehi, Mohammadreza, et al.
Pubblicazione: (2024)
di: Salehi, Mohammadreza, et al.
Pubblicazione: (2024)
MolmoPoint: Better Pointing for VLMs with Grounding Tokens
di: Clark, Christopher, et al.
Pubblicazione: (2026)
di: Clark, Christopher, et al.
Pubblicazione: (2026)
Contrastive Flow Matching
di: Stoica, George, et al.
Pubblicazione: (2025)
di: Stoica, George, et al.
Pubblicazione: (2025)
Infini-gram: Scaling Unbounded n-gram Language Models to a Trillion Tokens
di: Liu, Jiacheng, et al.
Pubblicazione: (2024)
di: Liu, Jiacheng, et al.
Pubblicazione: (2024)
Infini-gram mini: Exact n-gram Search at the Internet Scale with FM-Index
di: Xu, Hao, et al.
Pubblicazione: (2025)
di: Xu, Hao, et al.
Pubblicazione: (2025)
Posterior Augmented Flow Matching
di: Stoica, George, et al.
Pubblicazione: (2026)
di: Stoica, George, et al.
Pubblicazione: (2026)
Unified Spatio-Temporal Token Scoring for Efficient Video VLMs
di: Zhang, Jianrui, et al.
Pubblicazione: (2026)
di: Zhang, Jianrui, et al.
Pubblicazione: (2026)
Don't throw away your value model! Generating more preferable text with Value-Guided Monte-Carlo Tree Search decoding
di: Liu, Jiacheng, et al.
Pubblicazione: (2023)
di: Liu, Jiacheng, et al.
Pubblicazione: (2023)
When Worse is Better: Navigating the compression-generation tradeoff in visual tokenization
di: Ramanujan, Vivek, et al.
Pubblicazione: (2024)
di: Ramanujan, Vivek, et al.
Pubblicazione: (2024)
Synthetic Visual Genome
di: Park, Jae Sung, et al.
Pubblicazione: (2025)
di: Park, Jae Sung, et al.
Pubblicazione: (2025)
Molmo2: Open Weights and Data for Vision-Language Models with Video Understanding and Grounding
di: Clark, Christopher, et al.
Pubblicazione: (2026)
di: Clark, Christopher, et al.
Pubblicazione: (2026)
APT: Adaptive Pruning and Tuning Pretrained Language Models for Efficient Training and Inference
di: Zhao, Bowen, et al.
Pubblicazione: (2024)
di: Zhao, Bowen, et al.
Pubblicazione: (2024)
The Unmet Promise of Synthetic Training Images: Using Retrieved Real Images Performs Better
di: Geng, Scott, et al.
Pubblicazione: (2024)
di: Geng, Scott, et al.
Pubblicazione: (2024)
REALEDIT: Reddit Edits As a Large-scale Empirical Dataset for Image Transformations
di: Sushko, Peter, et al.
Pubblicazione: (2025)
di: Sushko, Peter, et al.
Pubblicazione: (2025)
Organize the Web: Constructing Domains Enhances Pre-Training Data Curation
di: Wettig, Alexander, et al.
Pubblicazione: (2025)
di: Wettig, Alexander, et al.
Pubblicazione: (2025)
OmniView: An All-Seeing Diffusion Model for 3D and 4D View Synthesis
di: Fan, Xiang, et al.
Pubblicazione: (2025)
di: Fan, Xiang, et al.
Pubblicazione: (2025)
Critical Batch Size Revisited: A Simple Empirical Approach to Large-Batch Language Model Training
di: Merrill, William, et al.
Pubblicazione: (2025)
di: Merrill, William, et al.
Pubblicazione: (2025)
Husky: A Unified, Open-Source Language Agent for Multi-Step Reasoning
di: Kim, Joongwon, et al.
Pubblicazione: (2024)
di: Kim, Joongwon, et al.
Pubblicazione: (2024)
ScienceMeter: Tracking Scientific Knowledge Updates in Language Models
di: Wang, Yike, et al.
Pubblicazione: (2025)
di: Wang, Yike, et al.
Pubblicazione: (2025)
HREF: Human Response-Guided Evaluation of Instruction Following in Language Models
di: Lyu, Xinxi, et al.
Pubblicazione: (2024)
di: Lyu, Xinxi, et al.
Pubblicazione: (2024)
BTR: Binary Token Representations for Efficient Retrieval Augmented Language Models
di: Cao, Qingqing, et al.
Pubblicazione: (2023)
di: Cao, Qingqing, et al.
Pubblicazione: (2023)
Unpacking DPO and PPO: Disentangling Best Practices for Learning from Preference Feedback
di: Ivison, Hamish, et al.
Pubblicazione: (2024)
di: Ivison, Hamish, et al.
Pubblicazione: (2024)
CopyBench: Measuring Literal and Non-Literal Reproduction of Copyright-Protected Text in Language Model Generation
di: Chen, Tong, et al.
Pubblicazione: (2024)
di: Chen, Tong, et al.
Pubblicazione: (2024)
Superposed Decoding: Multiple Generations from a Single Autoregressive Inference Pass
di: Shen, Ethan, et al.
Pubblicazione: (2024)
di: Shen, Ethan, et al.
Pubblicazione: (2024)
Arithmetic Sparsity and Obstructions in Weighted Projective Spaces
di: Shaska, Tanush
Pubblicazione: (2025)
di: Shaska, Tanush
Pubblicazione: (2025)
Superelliptic curves with minimal weighted moduli height
di: Shaska, Tanush
Pubblicazione: (2019)
di: Shaska, Tanush
Pubblicazione: (2019)
One Trajectory, One Token: Grounded Video Tokenization via Panoptic Sub-object Trajectory
di: Zheng, Chenhao, et al.
Pubblicazione: (2025)
di: Zheng, Chenhao, et al.
Pubblicazione: (2025)
vla-eval: A Unified Evaluation Harness for Vision-Language-Action Models
di: Choi, Suhwan, et al.
Pubblicazione: (2026)
di: Choi, Suhwan, et al.
Pubblicazione: (2026)
ComPO: Community Preferences for Language Model Personalization
di: Kumar, Sachin, et al.
Pubblicazione: (2024)
di: Kumar, Sachin, et al.
Pubblicazione: (2024)
EvalTree: Profiling Language Model Weaknesses via Hierarchical Capability Trees
di: Zeng, Zhiyuan, et al.
Pubblicazione: (2025)
di: Zeng, Zhiyuan, et al.
Pubblicazione: (2025)
MutaGReP: Execution-Free Repository-Grounded Plan Search for Code-Use
di: Khan, Zaid, et al.
Pubblicazione: (2025)
di: Khan, Zaid, et al.
Pubblicazione: (2025)
Do Membership Inference Attacks Work on Large Language Models?
di: Duan, Michael, et al.
Pubblicazione: (2024)
di: Duan, Michael, et al.
Pubblicazione: (2024)
Convergent Functions, Divergent Forms
di: Jeon, Hyeonseong, et al.
Pubblicazione: (2025)
di: Jeon, Hyeonseong, et al.
Pubblicazione: (2025)
Selective Visual Representations Improve Convergence and Generalization for Embodied AI
di: Eftekhar, Ainaz, et al.
Pubblicazione: (2023)
di: Eftekhar, Ainaz, et al.
Pubblicazione: (2023)
TurnWise: The Gap between Single- and Multi-turn Language Model Capabilities
di: Graf, Victoria, et al.
Pubblicazione: (2026)
di: Graf, Victoria, et al.
Pubblicazione: (2026)
Answer, Assemble, Ace: Understanding How LMs Answer Multiple Choice Questions
di: Wiegreffe, Sarah, et al.
Pubblicazione: (2024)
di: Wiegreffe, Sarah, et al.
Pubblicazione: (2024)
Train for Truth, Keep the Skills: Binary Retrieval-Augmented Reward Mitigates Hallucinations
di: Chen, Tong, et al.
Pubblicazione: (2025)
di: Chen, Tong, et al.
Pubblicazione: (2025)
MentorCollab: Selective Large-to-Small Inference-Time Guidance for Efficient Reasoning
di: Wang, Haojin, et al.
Pubblicazione: (2026)
di: Wang, Haojin, et al.
Pubblicazione: (2026)
From Shinkansen to Spacecraft Propulsion: The Role of Superconductivity and Electromagnetism In Modern Engineering
di: Shenai, Tanush Nayan
Pubblicazione: (2025)
di: Shenai, Tanush Nayan
Pubblicazione: (2025)
Synthetic Object Compositions for Scalable and Accurate Learning in Detection, Segmentation, and Grounding
di: Huang, Weikai, et al.
Pubblicazione: (2025)
di: Huang, Weikai, et al.
Pubblicazione: (2025)
Documenti analoghi
-
ActionAtlas: A VideoQA Benchmark for Domain-specialized Action Recognition
di: Salehi, Mohammadreza, et al.
Pubblicazione: (2024) -
MolmoPoint: Better Pointing for VLMs with Grounding Tokens
di: Clark, Christopher, et al.
Pubblicazione: (2026) -
Contrastive Flow Matching
di: Stoica, George, et al.
Pubblicazione: (2025) -
Infini-gram: Scaling Unbounded n-gram Language Models to a Trillion Tokens
di: Liu, Jiacheng, et al.
Pubblicazione: (2024) -
Infini-gram mini: Exact n-gram Search at the Internet Scale with FM-Index
di: Xu, Hao, et al.
Pubblicazione: (2025)