TechFeedTechFeed
AI/LLM

키미 K3 완전 분석 2026 | 2.8T 오픈·1M 컨텍스트·API 가격

문샷 AI 키미 K3(Kimi K3) 2.8조 파라미터 오픈 예정 모델의 스펙, API 모델명 kimi-k3, reasoning_effort, 캐시 히트·미스·출력 토큰 단가, 장시간 코딩 에이전트 한계를 공식 문서 기준으로 정리한다. 개발자 LLM·AI 코딩 도구·오픈소스 가중치 선택과 클로드·코파일럿 분기, 보안 체크까지 한 글에 담았다.

by

2026년 7월 16일 문샷 AI(Moonshot AI)가 키미 K3(Kimi K3)를 공개했다. 파라미터 2.8조(2.8T), 컨텍스트 100만 토큰, 네이티브 비전. 회사 표현으로는 3조 파라미터급 오픈 모델 중 첫 사례다. 전체 가중치 공개 목표는 7월 27일이다.


지금 당장 쓸 수 있는 경로는 키미 웹·앱, 키미 코드(Kimi Code), API 모델명 kimi-k3다. 아래는 스펙 표, API 호출, 가격 감각, 코딩 에이전트로 쓸 때 주의점, 클로드·오픈AI 대비 분기만 정리한다. “써 보니 최고” 같은 체감 평가는 빼고, 공식 문서·기술 블로그에 적힌 숫자와 제약만 따른다.


키미 K3가 뭔지 | 2.8T · 1M 컨텍스트 · 오픈 예정

키미 K3는 베이징 기반 문샷 AI의 플래그십 모델이다. 공식 기술 블로그·플랫폼 문서 기준으로 고정할 수 있는 항목은 아래 표다.


항목 공식 발표 기준
규모 2.8조 파라미터 · MoE(896 전문가 중 16 활성)
컨텍스트 100만 토큰 · 컨텍스트 캐시 자동
멀티모달 네이티브 비전(이미지·영상 입력 지원 문서화)
초점 장시간 코딩 · 지식 업무 · 추론
가중치 2026-07-27까지 전체 가중치 공개 예정(발표 시점 기준)
아키텍처 키워드 Kimi Delta Attention(KDA) · Attention Residuals · Stable LatentMoE

회사 스스로도 “전체 성능은 가장 강한 폐쇄 모델(클로드 페이블 5·GPT-5.6 솔 등)에 아직 못 미친다”고 적었다. 오픈 3T급 스케일과 코딩·에이전트 벤치에서 앞선 지점이 차별 포인트다. 이전 오픈웨이트 계열 맥락: 코파일럿 앱·키미 K2.7 선택.


대규모 오픈 AI 모델과 코딩 에이전트 작업 이미지
키미 K3 | 2.8T 오픈 예정 플래그십 · 장시간 코딩·1M 컨텍스트가 공식 메시지

API로 호출하기 | 모델명 kimi-k3 · OpenAI SDK

플랫폼 문서 기준 base URL은 https://api.moonshot.ai/v1, 모델 문자열은 kimi-k3다. OpenAI 호환 SDK로 붙는다. 플래그십이라 최소 충전(문서상 $1) 후 잠금이 풀리는 계정 정책이 있다. 레이트리밋·티어는 누적 충전액에 연동된다.


추론(thinking)은 항상 켜져 있다. 끌 수는 없고, reasoning_effortlow / high / max(기본 max)만 조절한다. 스트리밍 시 reasoning_content와 최종 content가 분리된다. 멀티턴·툴 호출에서는 assistant 메시지를 잘라 버리지 말고 통째로 다음 요청에 넣어야 한다.


키미 K3 기본 호출 (Python · OpenAI SDK)
import os from openai import OpenAI client = OpenAI( api_key=os.environ["MOONSHOT_API_KEY"], base_url="https://api.moonshot.ai/v1", ) completion = client.chat.completions.create( model="kimi-k3", reasoning_effort="max", # low | high | max messages=[ {"role": "user", "content": "이 레포의 실패 테스트 원인 후보 3가지만 짧게."} ], ) print(completion.choices[0].message.content)

비전 입력은 content를 문자열로 직렬화하면 안 되고, 객체 배열로 넣는다. 공개 이미지 URL은 지원하지 않고 base64 또는 업로드 파일 ms://<file-id> 형태다. 웹 검색 공식 툴은 문서상 “업데이트 중·당분간 프로덕션 비권장”이다. 에이전트 도구는 Formula 엔드포인트 연동 패턴이 별도 가이드로 있다.


관련 도구 글: 클로드 코드 개요 · AGENTS.md 작성.


가격 감각 | 캐시 히트·미스·출력 토큰

공식 런칭 글에 적힌 API 단가(백만 토큰당, USD)다. 컨텍스트 길이에 따른 구간 요금이 아니라 단일 요율이다.


구분 단가 (공식 블로그)
입력 · 캐시 히트 $0.30 / 1M tokens
입력 · 캐시 미스 $3.00 / 1M tokens
출력 $15.00 / 1M tokens

코딩 워크로드에서 캐시 히트율이 높다는 주장(공식: 90% 이상 사례)이 가격 구조를 지탱한다. 긴 시스템 프롬프트·레포 요약을 앞에 고정해 두고 질문만 바꾸면 캐시가 붙기 쉽다. 문서상 이전 요청 프롬프트 토큰이 256 미만이면 캐시 대상이 아니다.


카드 결제·환율·VAT는 계정·결제 대행사 정책을 따른다. 여기서는 USD 공시만 옮긴다. 구독형 코딩 도구 예산 비교: 깃허브 코파일럿 가격 매뉴얼 · 클로드 코드 요금.


API 요금과 토큰 사용량 대시보드 이미지
키미 K3 API | 캐시 히트·미스 단가 분리 · 긴 프리픽스 고정이 비용 변수

코딩·에이전트로 쓸 때 | 강점과 공식 한계

공식 포지셔닝은 장시간(long-horizon) 코딩이다. 큰 코드베이스 탐색, 터미널 도구 조율, 스크린샷을 넣은 프론트·게임·CAD 루프를 강조한다. 접근 채널은 키미 코드 터미널(/model로 K3 선택), 키미 Work 데스크톱, 웹/앱, API다.


동시에 공식 Limitations에 적힌 제약은 그대로 설계에 넣어야 한다.


  • thinking 이력 민감 — 과거 reasoning을 잘라 버리거나, 다른 모델 세션 중간에 K3로 갈아타면 품질이 흔들릴 수 있다. 호환 검증된 하네스(키미 코드 등)를 권장.
  • 과도한 선제 행동 — 애매한 의도에서도 임의로 결정을 밀고 나갈 수 있다. 시스템 프롬프트·AGENTS.md에 경계 조건을 명시.
  • 체감 UX 갭 — 벤치와 별개로 페이블 5·GPT-5.6 솔 대비 사용 경험 차이는 회사가 인정.

즉 “벤치 1등 모델로 전 팀 표준”이 아니라, 오픈 가중치·셀프호스트 후보·장시간 에이전트 실험 트랙으로 두는 편이 발표 톤과 맞다. 프로덕션 바이브코딩 점검: 바이브코딩 체크리스트.


가중치 공개 전 체크: 런칭 직후 허깅페이스 등 미러가 비어 있을 수 있다. “오픈 예정”과 “지금 로컬 서빙 가능”은 다르다. 7월 27일 목표 일정·추론 파트너 정렬 상태를 공식 블로그·플랫폼 공지로 다시 확인한 뒤 인프라 예산을 잡는다.

언제 K3인가 | 클로드·오픈AI·코파일럿과 분기

역할이 겹치지만 계약·데이터 거버넌스·운영 형태가 다르다.


상황 우선 후보 이유(요약)
IDE 기본 자동완성·팀 SSO 깃허브 코파일럿 등 워크스페이스 통합·요금 예측이 단순
사내 보안·감사·클로드 스택 클로드 엔터프라이즈·코드 기존 앤트로픽 계약·에이전트 생태계
오픈 가중치 실험·셀프호스트 준비 키미 K3 3T급 오픈·가중치 일정·API 즉시 시험
장시간 자율 코딩 PoC K3 또는 하네스 검증된 에이전트 thinking 이력·도구 루프 제약을 문서대로 맞출 때

데이터 국경·라이선스·수출 통제·사내 보안 심사는 모델 벤치보다 먼저다. 중국 랩 모델 도입 시 법무·보안 체크리스트를 통과시키지 않은 채 API 키만 뿌리면 안 된다. 프론티어 랩 동향: 클로드 페이블 5 · GPT-5.6 솔 보안 이슈.


AI 코딩 도구 비교와 선택 분기 이미지
선택 분기 | IDE 구독 vs 엔터프라이즈 클로드 vs 오픈 가중치 실험 트랙

도입 전 체크리스트 | 5분 점검

  • 계정 충전·키 발급 완료 여부, 모델 잠금 해제 상태
  • base_url·모델명 kimi-k3 고정, temperature 등 고정 파라미터 문서 확인
  • 에이전트 하네스가 thinking 이력을 보존하는지
  • 시스템 프롬프트에 “임의 커밋/배포 금지” 등 행동 경계 명시
  • 캐시 히트를 노린 긴 프리픽스 설계 여부(256 토큰 하한 포함)
  • 가중치 공개 후 셀프호스트 GPU·vLLM KDA 캐시 지원 일정
  • 보안·라이선스·데이터 반출 정책 서명 여부

이 목록을 통과한 뒤에야 팀 표준 후보 토론이 의미 있다. 벤치 스크린샷만 공유하는 단계는 아직 조사다.


참고 자료


자주 묻는 질문

키미 K3는 지금 로컬에서 돌릴 수 있나?

런칭 시점 기준 전체 가중치는 7월 27일 공개 예정이었다. 그 전에는 웹·앱·키미 코드·API가 주 경로다. 공개 후에도 2.8T급은 일반 노트북 단일 GPU로는 현실적이지 않고, 추론 파트너·대규모 클러스터 가이드를 따른다.


thinking을 끄고 빠르게만 받을 수 있나?

끌 수 없다. 항상 thinking 모드다. 대신 reasoning_effortlow로 두면 추론 부담을 줄일 수 있다. 기본값은 max다.


가격이 클로드·GPT보다 싸다고 단정해도 되나?

안 된다. 토큰 단가·캐시 히트율·출력 길이·도구 루프 횟수가 총비용을 바꾼다. 공식 단가표와 실제 트레이스 로그로 비교해야 한다.


클로드 코드 세션 중간에 K3로 바꿔도 되나?

공식 한계에 “다른 모델 세션을 중간에 K3로 전환하면 품질이 불안정할 수 있다”고 적혀 있다. 새 세션·호환 하네스에서 시작하는 편이 안전하다.


이미지 URL만 넘기면 비전 분석이 되나?

공개 URL 직접 입력은 문서상 미지원이다. base64 데이터 URL 또는 파일 업로드 후 ms:// 식별자를 쓴다. content는 배열 형식이어야 한다.


기업 데이터에 바로 넣어도 되나?

벤치와 무관하게 보안·계약·데이터 처리 지역·라이선스를 먼저 본다. 키미 엔터프라이즈 상품이 별도로 안내되어 있으니, 개인 API 키로 사내 소스를 올리는 방식과 혼동하지 않는다.


키미 K3Kimi K3문샷 AIMoonshot오픈소스 LLMAI 코딩API1M 컨텍스트개발자에이전트오픈웨이트

관련 도구

함께 보면 좋은 문제 해결

EXPLORE / AI/LLM

이어서 읽어보기

전체 토픽 둘러보기