Seg the HAB: Language-Guided Geospatial Algae Bloom Reasoning and Segmentation
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Hsieh, Patterson, Yeh, Jerry, He, Mao-Chi, Hsieh, Wen-Han, Hsieh, Elvis |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
ZonUI-3B: A Lightweight Vision-Language Model for Cross-Resolution GUI Grounding
par: Hsieh, ZongHan, et autres
Publié: (2025)
par: Hsieh, ZongHan, et autres
Publié: (2025)
Seg-Agent: Test-Time Multimodal Reasoning for Training-Free Language-Guided Segmentation
par: Hao, Chao, et autres
Publié: (2026)
par: Hao, Chao, et autres
Publié: (2026)
One Token to Seg Them All: Language Instructed Reasoning Segmentation in Videos
par: Bai, Zechen, et autres
Publié: (2024)
par: Bai, Zechen, et autres
Publié: (2024)
SegLLM: Multi-round Reasoning Segmentation
par: Wang, XuDong, et autres
Publié: (2024)
par: Wang, XuDong, et autres
Publié: (2024)
WeatherReasonSeg: A Benchmark for Weather-Aware Reasoning Segmentation in Visual Language Models
par: Du, Wanjun, et autres
Publié: (2026)
par: Du, Wanjun, et autres
Publié: (2026)
Construction Site Scaffolding Completeness Detection Based on Mask R-CNN and Hough Transform
par: Lin, Pei-Hsin, et autres
Publié: (2025)
par: Lin, Pei-Hsin, et autres
Publié: (2025)
One-Forcing: Towards Stable One-Step Autoregressive Video Generation
par: Feng, Jiaqi, et autres
Publié: (2026)
par: Feng, Jiaqi, et autres
Publié: (2026)
Mask-aware Text-to-Image Retrieval: Referring Expression Segmentation Meets Cross-modal Retrieval
par: Shen, Li-Cheng, et autres
Publié: (2025)
par: Shen, Li-Cheng, et autres
Publié: (2025)
Decoupled Seg Tokens Make Stronger Reasoning Video Segmenter and Grounder
par: Jisheng, Dang, et autres
Publié: (2025)
par: Jisheng, Dang, et autres
Publié: (2025)
Perception Tokens Enhance Visual Reasoning in Multimodal Language Models
par: Bigverdi, Mahtab, et autres
Publié: (2024)
par: Bigverdi, Mahtab, et autres
Publié: (2024)
GeoSeg: Training-Free Reasoning-Driven Segmentation in Remote Sensing Imagery
par: Jiang, Lifan, et autres
Publié: (2026)
par: Jiang, Lifan, et autres
Publié: (2026)
CORE-Seg: Reasoning-Driven Segmentation for Complex Lesions via Reinforcement Learning
par: Xie, Yuxin, et autres
Publié: (2026)
par: Xie, Yuxin, et autres
Publié: (2026)
DiffSeg: A Segmentation Model for Skin Lesions Based on Diffusion Difference
par: Shuai, Zhihao, et autres
Publié: (2024)
par: Shuai, Zhihao, et autres
Publié: (2024)
Text is All You Need for Vision-Language Model Jailbreaking
par: Chen, Yihang, et autres
Publié: (2026)
par: Chen, Yihang, et autres
Publié: (2026)
Gen4Gen: Generative Data Pipeline for Generative Multi-Concept Composition
par: Yeh, Chun-Hsiao, et autres
Publié: (2024)
par: Yeh, Chun-Hsiao, et autres
Publié: (2024)
QG-CoC: Question-Guided Chain-of-Captions for Large Multimodal Models
par: Kao, Kuei-Chun, et autres
Publié: (2025)
par: Kao, Kuei-Chun, et autres
Publié: (2025)
Very Efficient Listwise Multimodal Reranking for Long Documents
par: Sun, Yiqun, et autres
Publié: (2026)
par: Sun, Yiqun, et autres
Publié: (2026)
Graph-Based Captioning: Enhancing Visual Descriptions by Interconnecting Region Captions
par: Hsieh, Yu-Guan, et autres
Publié: (2024)
par: Hsieh, Yu-Guan, et autres
Publié: (2024)
TinyFormer: Preserving Tiny Objects in YOLO-DETR Hybrid Real-time Detectors
par: Hsieh, Jun-Wei, et autres
Publié: (2026)
par: Hsieh, Jun-Wei, et autres
Publié: (2026)
R1-Zero's "Aha Moment" in Visual Reasoning on a 2B Non-SFT Model
par: Zhou, Hengguang, et autres
Publié: (2025)
par: Zhou, Hengguang, et autres
Publié: (2025)
LarvSeg: Exploring Image Classification Data For Large Vocabulary Semantic Segmentation via Category-wise Attentive Classifier
par: Yu, Haojun, et autres
Publié: (2025)
par: Yu, Haojun, et autres
Publié: (2025)
Mitigating Bias in Dataset Distillation
par: Cui, Justin, et autres
Publié: (2024)
par: Cui, Justin, et autres
Publié: (2024)
The Crystal Ball Hypothesis in diffusion models: Anticipating object positions from initial noise
par: Ban, Yuanhao, et autres
Publié: (2024)
par: Ban, Yuanhao, et autres
Publié: (2024)
Text2Seg: Remote Sensing Image Semantic Segmentation via Text-Guided Visual Foundation Models
par: Zhang, Jielu, et autres
Publié: (2023)
par: Zhang, Jielu, et autres
Publié: (2023)
R$^{2}$Seg: Training-Free OOD Medical Tumor Segmentation via Anatomical Reasoning and Statistical Rejection
par: Shen, Shuaike, et autres
Publié: (2025)
par: Shen, Shuaike, et autres
Publié: (2025)
Qwen3-VL-Seg: Unlocking Open-World Referring Segmentation with Vision-Language Grounding
par: Yao, Yuan, et autres
Publié: (2026)
par: Yao, Yuan, et autres
Publié: (2026)
Adaptive Diagnostic Reasoning Framework for Pathology with Multimodal Large Language Models
par: Hong, Yunqi, et autres
Publié: (2025)
par: Hong, Yunqi, et autres
Publié: (2025)
AutoRubric-T2I: Robust Rule-Based Reward Model for Text-to-Image Alignment
par: Kao, Kuei-Chun, et autres
Publié: (2026)
par: Kao, Kuei-Chun, et autres
Publié: (2026)
GenSeg-R1: RL-Driven Vision-Language Grounding for Fine-Grained Referring Segmentation
par: Hegde, Sandesh, et autres
Publié: (2026)
par: Hegde, Sandesh, et autres
Publié: (2026)
IRIS: Intrinsic Reward Image Synthesis
par: Chen, Yihang, et autres
Publié: (2025)
par: Chen, Yihang, et autres
Publié: (2025)
Navigating Text-To-Image Customization: From LyCORIS Fine-Tuning to Model Evaluation
par: Yeh, Shih-Ying, et autres
Publié: (2023)
par: Yeh, Shih-Ying, et autres
Publié: (2023)
MatchSeg: Towards Better Segmentation via Reference Image Matching
par: Huo, Jiayu, et autres
Publié: (2024)
par: Huo, Jiayu, et autres
Publié: (2024)
G4Seg: Generation for Inexact Segmentation Refinement with Diffusion Models
par: Zhang, Tianjiao, et autres
Publié: (2025)
par: Zhang, Tianjiao, et autres
Publié: (2025)
BiPVL-Seg: Bidirectional Progressive Vision-Language Fusion with Global-Local Alignment for Medical Image Segmentation
par: Sultan, Rafi Ibn, et autres
Publié: (2025)
par: Sultan, Rafi Ibn, et autres
Publié: (2025)
TAO-Amodal: A Benchmark for Tracking Any Object Amodally
par: Hsieh, Cheng-Yen, et autres
Publié: (2023)
par: Hsieh, Cheng-Yen, et autres
Publié: (2023)
AttrSeg: Open-Vocabulary Semantic Segmentation via Attribute Decomposition-Aggregation
par: Ma, Chaofan, et autres
Publié: (2023)
par: Ma, Chaofan, et autres
Publié: (2023)
SegMix:Shuffle-based Feedback Learning for Semantic Segmentation of Pathology Images
par: Yan, Zhiling, et autres
Publié: (2026)
par: Yan, Zhiling, et autres
Publié: (2026)
CSAD: Unsupervised Component Segmentation for Logical Anomaly Detection
par: Hsieh, Yu-Hsuan, et autres
Publié: (2024)
par: Hsieh, Yu-Hsuan, et autres
Publié: (2024)
Neural Network-Based Tracking and 3D Reconstruction of Baseball Pitch Trajectories from Single-View 2D Video
par: Hsieh, Jhen
Publié: (2024)
par: Hsieh, Jhen
Publié: (2024)
Unlabeled Data Improves Fine-Grained Image Zero-shot Classification with Multimodal LLMs
par: Hong, Yunqi, et autres
Publié: (2025)
par: Hong, Yunqi, et autres
Publié: (2025)
Documents similaires
-
ZonUI-3B: A Lightweight Vision-Language Model for Cross-Resolution GUI Grounding
par: Hsieh, ZongHan, et autres
Publié: (2025) -
Seg-Agent: Test-Time Multimodal Reasoning for Training-Free Language-Guided Segmentation
par: Hao, Chao, et autres
Publié: (2026) -
One Token to Seg Them All: Language Instructed Reasoning Segmentation in Videos
par: Bai, Zechen, et autres
Publié: (2024) -
SegLLM: Multi-round Reasoning Segmentation
par: Wang, XuDong, et autres
Publié: (2024) -
WeatherReasonSeg: A Benchmark for Weather-Aware Reasoning Segmentation in Visual Language Models
par: Du, Wanjun, et autres
Publié: (2026)