MiMo-V2.6-Flash는 MiMo-V2.6-Pro의 저비용, 고처리량 버전입니다. 텍스트, 이미지, 영상, 오디오를 아우르는 옴니모달 입력과 100만 토큰 컨텍스트, 최대 12.8만 토큰 출력은 Pro와 동일하지만, 가장 무거운 추론 작업이 아니라 일상적인 대규모 사용을 위한 가격으로 설계되었습니다. Glarity는 MiMo를 기본 옵션으로 제공하지 않지만, 설정 화면의 "커스텀 모델" 항목은 OpenAI 호환 /chat/completions 엔드포인트라면 어떤 것이든 연결할 수 있으며, 샤오미의 API도 이 형식에 맞습니다. 설정에는 약 5분이 걸리며, 설정 → 일반 → AI 연결에서 시작합니다.
MiMo-V2.6-Flash를 선택하는 이유
MiMo-V2.6-Pro가 플래그십이라면, Flash는 하루에 수십 개의 페이지를 요약해야 하는데 매번 플래그십 요금을 내고 싶지 않을 때 선택하는 모델입니다. 동일한 100만 토큰 컨텍스트와 멀티모달 입력을 유지하면서, 딥 씽킹, 툴 호출, 스트리밍, 웹 검색, 구조화된 출력, 컨텍스트 캐싱도 지원합니다. 샤오미는 이를 더 높은 처리량과 Pro의 극히 일부에 불과한 토큰당 비용에 맞춰 조정했으며, 방문하는 페이지마다 호출될 수 있는 확장 프로그램에는 이 점이 중요합니다.
시작하기 전에 필요한 것
- 샤오미 MiMo 콘솔에서 발급받은 API 키
- 아래의 연결 정보
Glarity 설정 단계
- Glarity 확장 프로그램을 열고 설정 → 일반으로 이동한 뒤, "빠른 Glarity 요약 및 번역을 위한 AI 연결" 항목까지 스크롤합니다.
- 연결 유형을 OpenAI API 키로 설정합니다.
- API 키 항목에 샤오미 키를 붙여넣습니다.
- 모델을 커스텀 모델로 설정하고
mimo-v2.6-flash를 입력합니다. - 모델 컨텍스트 윈도우를 100만에 가장 가까운 값으로 설정합니다.
- API 호스트를
https://api.xiaomimimo.com/v1로 설정합니다. - API 경로를
/chat/completions로 설정합니다. - 온도는 일반적인 용도로 0.5(더 충실한 요약을 원하면 0.2로), 테스트를 눌러 응답을 확인하고 저장합니다.
설정 한눈에 보기
항목 | 값 | 의미 |
|---|---|---|
연결 유형 | OpenAI API 키 | MiMo API는 OpenAI 채팅 완성 형식을 사용 |
API 키 | 사용자의 MiMo 키 | MiMo 콘솔에서 발급 |
모델 | 커스텀 모델 → | 공식 모델 ID |
모델 컨텍스트 윈도우 | 약 100만 | MiMo-V2.6-Flash의 공식 입력 한도 |
API 호스트 |
| 샤오미 공식 API 문서의 기본 URL |
API 경로 |
| 표준 OpenAI 호환 경로 |
온도 | 0.5(또는 0.2) | 자연스러운 표현과 충실한 출력 사이의 균형 |
가격
샤오미 공식 가격 페이지(2026년 9월 22일 업데이트)에 따르면 해외 요금은 100만 토큰당 캐시 입력 $0.0028, 비캐시 입력 $0.14, 출력 $0.28로, Pro 비캐시 요금의 약 3분의 1입니다. 중국 내 요금은 100만 토큰당 ¥0.02 / ¥1 / ¥2입니다. 이는 일상적인 페이지 및 영상 요약에는 Flash가 더 실용적인 기본 선택이 되며, 정말 깊은 추론이 필요한 작업에만 Pro를 사용하는 것이 합리적임을 의미합니다. 신규 모델은 요금이 변경될 수 있으니 사용 전 공식 가격 페이지를 확인하세요.
MiMo-Flash를 연결한 Glarity로 할 수 있는 것
기능 | 현재 동작 방식 |
|---|---|
번역 | 낮은 비용으로 페이지 텍스트나 선택 영역을 번역 |
페이지 요약 | 긴 글의 요점을 압축, 필요 시 100만 토큰 윈도우 활용 |
유튜브 요약 | 긴 영상의 대화록까지 포함해 요약 |
영상 자막 | 대화록을 바탕으로 자막 텍스트를 생성 및 번역 |
빠른 이메일 답장 | 선택한 텍스트를 바탕으로 짧은 답장 작성 |
원클릭 프롬프트 | 저장한 커스텀 프롬프트를 기본 모델 대신 Flash로 실행 |
문제 해결
- 401 / 인증 오류 — API 키가 유효하지 않거나 저장되지 않았습니다. 다시 붙여넣고 테스트를 다시 눌러보세요.
- "모델을 찾을 수 없음" — 모델 ID가 정확히
mimo-v2.6-flash인지 확인하세요. - 매우 긴 입력에서 요청 실패 — Flash의 한도는 입력 100만 토큰 / 출력 12.8만 토큰입니다.
- 어려운 질문에 대한 답변이 얕게 느껴짐 — Flash는 추론 깊이를 속도와 비용으로 교환합니다. 더 깊은 분석이 필요하면 MiMo-V2.6-Pro로 전환하세요.
- Glarity가 여전히 이전 모델을 사용 — 테스트가 성공한 후 저장을 눌러야만 설정이 반영됩니다.
자주 묻는 질문
MiMo-V2.6-Flash는 Glarity에서 공식적으로 지원되나요? 아닙니다. 이 가이드는 Glarity의 범용 커스텀 모델 설정을 통해 연결하는 방법입니다.
Flash는 MiMo-V2.6-Pro와 어떻게 다른가요? 둘 다 동일한 100만 토큰 컨텍스트와 멀티모달 입력을 공유하지만, Flash는 더 높은 처리량에 맞춰 조정되어 있으며 단가는 Pro의 비캐시 입력 및 출력 요금의 약 3분의 1입니다.
일상적인 요약 작업에 Flash로 충분한가요? 충분합니다. 페이지 및 영상 요약, 번역, 자막 작업에는 Flash의 속도와 비용이 더 실용적입니다. 더 깊은 추론이 필요할 때는 Pro를 사용하세요.
지속적으로 사용할 때 비용은 어느 정도인가요? 비캐시 입력 100만 토큰당 $0.14, 출력 100만 토큰당 $0.28을 기준으로, 동일한 사용량 대비 Pro보다 훨씬 적은 비용이 듭니다.
나중에 Pro나 UltraSpeed로 전환할 수 있나요? 가능합니다. 모델 항목을 mimo-v2.6-pro 또는 mimo-v2.6-pro-ultraspeed로 바꾸고 필요하면 컨텍스트 윈도우를 조정하면 됩니다. 호스트와 경로는 그대로 유지됩니다.
Glarity 편집팀은 AI 검색, 영상 요약, 브라우저 활용 팁을 다룹니다.
Glarity는 AI 검색과 YouTube 요약을 지원하는 무료 브라우저 확장 프로그램입니다(glarity.app에서 사용 가능).



