Qwen, 옴니모달 모델 Qwen3.8 출시
Qwen이 9월 18일 차세대 네이티브 옴니모달 모델 ‘Qwen3.8-Omni-Flash’를 출시하고 Qianwen AI Platform에서 제공하기 시작했다. 텍스트·이미지·음성·영상을 입력받아 내용을 이해하는 데 그치지 않고, 작업 계획과 도구 호출을 거쳐 결과물까지 만드는 에이전트 기능에 초점을 맞췄다. 컨텍스트 창은 100만 토큰이며 영상 편집, 뮤직비디오 제작, 영화 제작·해설, 시청각 요약, 실시간 대화 등을 지원한다.1
Qwen 발표에 따르면 29개 평가의 평균 점수는 Qwen3.5-Omni-Plus보다 25% 넘게 올랐다. 시청각 에이전트 평가에서는 WildClawBench-MM이 36.5점, AgenticVBench가 22.3점 상승했고 UniClawBench에서는 69.6점을 기록했다. 장시간 음성 평가 LongAudioSpan은 8.3점, OmniVideoBench는 9.6점 개선됐다. 회의 음성 인식 지표인 AliMeeting DER과 cpWER은 각각 88.11·89.61에서 3.35·17.18로 낮아졌다.1
시간당 API 입력 가격도 이전 모델보다 음성은 98% 이상, 시청각은 93% 이상 낮아졌다는 것이 Qwen의 설명이다. 다만 이 비용은 2분 분량의 입력 비용을 30배하고, 시청각 입력은 720p·초당 1프레임으로 환산한 추정치다. Gemini 3.8 Flash에 근접한 시청각 성능과 이를 웃도는 종합 음성 성능이라는 비교 역시 Qwen 자체 평가에 근거한다.1
Footnotes#
읽기 목록은 이 브라우저에 저장됩니다.
출처
- Qwen3.8-Omni-Flash: Omni Senses. Agentic Delivery. — Qwen 공식 연구·발표 · 자료: 2026. 9. 18.
이 글은 위 출처를 근거로 자동 생성된 뒤 발행됐습니다. 원문을 함께 확인해 주세요. 교차 보도 없이 단독 출처로 작성됐습니다.