OpenSeal: Good, Fast, and Cheap Construction of an Open-Source Southeast Asian LLM via Parallel Data
Fuente:
arXiv
Saved in:
| Main Authors: | Nguyen, Tan Sang, Qorib, Muhammad Reza, Ng, Hwee Tou |
|---|---|
| Format: | Preprint |
| Published: |
2026
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Just Go Parallel: Improving the Multilingual Capabilities of Large Language Models
by: Qorib, Muhammad Reza, et al.
Published: (2025)
by: Qorib, Muhammad Reza, et al.
Published: (2025)
Parametric Knowledge is Not All You Need: Toward Honest Large Language Models via Retrieval of Pretraining Data
by: Kusuma, Christopher Adrian, et al.
Published: (2026)
by: Kusuma, Christopher Adrian, et al.
Published: (2026)
Just What You Desire: Constrained Timeline Summarization with Self-Reflection for Enhanced Relevance
by: Qorib, Muhammad Reza, et al.
Published: (2024)
by: Qorib, Muhammad Reza, et al.
Published: (2024)
Efficient and Interpretable Grammatical Error Correction with Mixture of Experts
by: Qorib, Muhammad Reza, et al.
Published: (2024)
by: Qorib, Muhammad Reza, et al.
Published: (2024)
Reasoning Models Hallucinate More: Factuality-Aware Reinforcement Learning for Large Reasoning Models
by: Li, Junyi, et al.
Published: (2025)
by: Li, Junyi, et al.
Published: (2025)
Towards Robust Temporal Reasoning of Large Language Models via a Multi-Hop QA Dataset and Pseudo-Instruction Tuning
by: Tan, Qingyu, et al.
Published: (2023)
by: Tan, Qingyu, et al.
Published: (2023)
SlideTailor: Personalized Presentation Slide Generation for Scientific Papers
by: Zeng, Wenzheng, et al.
Published: (2025)
by: Zeng, Wenzheng, et al.
Published: (2025)
Think&Cite: Improving Attributed Text Generation with Self-Guided Tree Search and Progress Reward Modeling
by: Li, Junyi, et al.
Published: (2024)
by: Li, Junyi, et al.
Published: (2024)
Preference-Guided Reflective Sampling for Aligning Language Models
by: Ye, Hai, et al.
Published: (2024)
by: Ye, Hai, et al.
Published: (2024)
Self-Judge: Selective Instruction Following with Alignment Self-Evaluation
by: Ye, Hai, et al.
Published: (2024)
by: Ye, Hai, et al.
Published: (2024)
Game of Thought: Robust Information Seeking with Large Language Models Using Game Theory
by: Cui, Langyuan, et al.
Published: (2026)
by: Cui, Langyuan, et al.
Published: (2026)
FocusUI: Efficient UI Grounding via Position-Preserving Visual Token Selection
by: Ouyang, Mingyu, et al.
Published: (2026)
by: Ouyang, Mingyu, et al.
Published: (2026)
Factorized Learning for Temporally Grounded Video-Language Models
by: Zeng, Wenzheng, et al.
Published: (2025)
by: Zeng, Wenzheng, et al.
Published: (2025)
Prompting and Fine-Tuning Open-Sourced Large Language Models for Stance Classification
by: Cruickshank, Iain J., et al.
Published: (2023)
by: Cruickshank, Iain J., et al.
Published: (2023)
IRLBench: A Multi-modal, Culturally Grounded, Parallel Irish-English Benchmark for Open-Ended LLM Reasoning Evaluation
by: Tran, Khanh-Tung, et al.
Published: (2025)
by: Tran, Khanh-Tung, et al.
Published: (2025)
Multi-Agent Sampling: Scaling Inference Compute for Data Synthesis with Tree Search-Based Agentic Collaboration
by: Ye, Hai, et al.
Published: (2024)
by: Ye, Hai, et al.
Published: (2024)
OpenSeeker: Democratizing Frontier Search Agents by Fully Open-Sourcing Training Data
by: Du, Yuwen, et al.
Published: (2026)
by: Du, Yuwen, et al.
Published: (2026)
ViSoLex: An Open-Source Repository for Vietnamese Social Media Lexical Normalization
by: Nguyen, Anh Thi-Hoang, et al.
Published: (2025)
by: Nguyen, Anh Thi-Hoang, et al.
Published: (2025)
SEALGuard: Safeguarding the Multilingual Conversations in Southeast Asian Languages for LLM Software Systems
by: Shan, Wenliang, et al.
Published: (2025)
by: Shan, Wenliang, et al.
Published: (2025)
MiniLingua: A Small Open-Source LLM for European Languages
by: Aksenova, Anna, et al.
Published: (2025)
by: Aksenova, Anna, et al.
Published: (2025)
An Open Source Data Contamination Report for Large Language Models
by: Li, Yucheng, et al.
Published: (2023)
by: Li, Yucheng, et al.
Published: (2023)
F2LLM Technical Report: Matching SOTA Embedding Performance with 6 Million Open-Source Data
by: Zhang, Ziyin, et al.
Published: (2025)
by: Zhang, Ziyin, et al.
Published: (2025)
Finding the Sweet Spot: Preference Data Construction for Scaling Preference Optimization
by: Xiao, Yao, et al.
Published: (2025)
by: Xiao, Yao, et al.
Published: (2025)
Medmarks: A Comprehensive Open-Source LLM Benchmark Suite for Medical Tasks
by: Warner, Benjamin, et al.
Published: (2026)
by: Warner, Benjamin, et al.
Published: (2026)
The LLM Bottleneck: Why Open-Source Vision LLMs Struggle with Hierarchical Visual Recognition
by: Tan, Yuwen, et al.
Published: (2025)
by: Tan, Yuwen, et al.
Published: (2025)
SEADialogues: A Multilingual Culturally Grounded Multi-turn Dialogue Dataset on Southeast Asian Languages
by: Kautsar, Muhammad Dehan Al, et al.
Published: (2025)
by: Kautsar, Muhammad Dehan Al, et al.
Published: (2025)
OpenMathInstruct-2: Accelerating AI for Math with Massive Open-Source Instruction Data
by: Toshniwal, Shubham, et al.
Published: (2024)
by: Toshniwal, Shubham, et al.
Published: (2024)
Edu-ConvoKit: An Open-Source Library for Education Conversation Data
by: Wang, Rose E., et al.
Published: (2024)
by: Wang, Rose E., et al.
Published: (2024)
OpenR: An Open Source Framework for Advanced Reasoning with Large Language Models
by: Wang, Jun, et al.
Published: (2024)
by: Wang, Jun, et al.
Published: (2024)
OpenFActScore: Open-Source Atomic Evaluation of Factuality in Text Generation
by: Lage, Lucas Fonseca, et al.
Published: (2025)
by: Lage, Lucas Fonseca, et al.
Published: (2025)
LLM-Based Section Identifiers Excel on Open Source but Stumble in Real World Applications
by: Krishnamoorthy, Saranya, et al.
Published: (2024)
by: Krishnamoorthy, Saranya, et al.
Published: (2024)
Aqulia-Med LLM: Pioneering Full-Process Open-Source Medical Language Models
by: Zhao, Lulu, et al.
Published: (2024)
by: Zhao, Lulu, et al.
Published: (2024)
DeepSeek LLM: Scaling Open-Source Language Models with Longtermism
by: DeepSeek-AI, et al.
Published: (2024)
by: DeepSeek-AI, et al.
Published: (2024)
Is Open Source the Future of AI? A Data-Driven Approach
by: Vake, Domen, et al.
Published: (2025)
by: Vake, Domen, et al.
Published: (2025)
Fabricator: An Open Source Toolkit for Generating Labeled Training Data with Teacher LLMs
by: Golde, Jonas, et al.
Published: (2023)
by: Golde, Jonas, et al.
Published: (2023)
Steel-LLM:From Scratch to Open Source -- A Personal Journey in Building a Chinese-Centric LLM
by: Gu, Qingshui, et al.
Published: (2025)
by: Gu, Qingshui, et al.
Published: (2025)
VITA: Towards Open-Source Interactive Omni Multimodal LLM
by: Fu, Chaoyou, et al.
Published: (2024)
by: Fu, Chaoyou, et al.
Published: (2024)
Agent-UniRAG: A Trainable Open-Source LLM Agent Framework for Unified Retrieval-Augmented Generation Systems
by: Pham, Hoang, et al.
Published: (2025)
by: Pham, Hoang, et al.
Published: (2025)
SEA-HELM: Southeast Asian Holistic Evaluation of Language Models
by: Susanto, Yosephine, et al.
Published: (2025)
by: Susanto, Yosephine, et al.
Published: (2025)
Orchard: An Open-Source Agentic Modeling Framework
by: Peng, Baolin, et al.
Published: (2026)
by: Peng, Baolin, et al.
Published: (2026)
Similar Items
-
Just Go Parallel: Improving the Multilingual Capabilities of Large Language Models
by: Qorib, Muhammad Reza, et al.
Published: (2025) -
Parametric Knowledge is Not All You Need: Toward Honest Large Language Models via Retrieval of Pretraining Data
by: Kusuma, Christopher Adrian, et al.
Published: (2026) -
Just What You Desire: Constrained Timeline Summarization with Self-Reflection for Enhanced Relevance
by: Qorib, Muhammad Reza, et al.
Published: (2024) -
Efficient and Interpretable Grammatical Error Correction with Mixture of Experts
by: Qorib, Muhammad Reza, et al.
Published: (2024) -
Reasoning Models Hallucinate More: Factuality-Aware Reinforcement Learning for Large Reasoning Models
by: Li, Junyi, et al.
Published: (2025)