← Back to Model Beat
Open Source·4d ago·all news from August 18, 2026

MOSS-VL Technical Report

Researchers have introduced MOSS-VL, a family of open-source vision-language models engineered for simultaneous perception and speech generation. By integrating vision processing directly into the language decoder’s architecture, the model aims to support real-time, interactive performance.

Covered by 1 source

  • AarXiv CS.AIPengyu Wang, Chenkun Tan, Shaojun Zhou, Qirui Zhou, Yanxin Chen, Xingyang He, Huazheng Zeng, Jijun Cheng, Chenghao Wang, Xiaomeng Qian, Pengfei Wang, Zhan Huang, Shanqing Gao, Wei Huang, Longjun Cao, Wu Ran, Jie Liu, Changtai Zhu, Hongkai Wang, Yixian Tian, Chenghao Liu, Zhen Ye, Xinghao Wang, Botian Jiang, Guoguo Feng, Zhaoye Fei, Ruixiao Li, Mingshu Chen, Yang Gao, Qinyuan Cheng, Shimin Li, Xipeng Qiu4d ago

Related stories

Open SourceChina's Zhipu Says Open-Source GLM-5.3 Outperforms Anthropic's Restricted Model in Vulnerability DetectionAug 14 · 7 sourcesOpen SourceAlayaWorld: Interactive Long-Horizon World Modeling - Full Technical Report (v1.1)Aug 14Open SourceMARC v1: An Open-Source Multi-Agent Framework for Clinical AI Reasoning and CoordinationAug 14Open SourceAuditable agentic AI for evidence-grounded thyroid ultrasound diagnosis and reportingAug 14