kimi-k3는 장기 프로그래밍, 에이전트, 복잡한 추론 및 지식 작업을 대상으로 하며, OpenAI 호환 Chat Completions API를 통해 호출할 수 있습니다.
이 문서는 Kimi Chat Completion API 작업의 사용 프로세스를 주로 소개하며, 이를 통해 공식 Kimi의 대화 기능을 쉽게 사용할 수 있습니다.
신청 프로세스
Kimi Chat Completion API를 사용하려면 먼저 Ace Data Cloud 콘솔에서 API Token을 받아야 하며, 이를 보관해 두십시오.
로그인 또는 등록이 되어 있지 않은 경우, 자동으로 로그인 페이지로 리디렉션되어 등록 및 로그인을 요청합니다. 완료 후 현재 페이지로 자동으로 돌아옵니다.
하나의 API Token으로 플랫폼의 모든 서비스를 호출할 수 있으며, 각 서비스에 대해 별도로 신청할 필요가 없습니다. 처음 신청 시 무료 크레딧이 제공되어 무료로 체험할 수 있으며, 크레딧이 부족할 경우 콘솔에서 일반 잔액을 충전할 수 있습니다.
📘 전체 문서: Kimi Chat Completion API →
기본 사용
이제 인터페이스에 해당 내용을 입력할 수 있습니다. 아래 그림과 같이 진행하십시오:
authorization은 드롭다운 목록에서 직접 선택할 수 있으며; model은 Kimi 모델을 선택하는 데 사용되며, kimi-k3를 추천합니다; messages는 대화 메시지 배열로, 각 메시지는 role과 content를 포함하며, role은 user, assistant, system 및 tool을 지원합니다.
또한 오른쪽에 해당 호출 코드 생성이 있음을 알 수 있으며, 코드를 복사하여 직접 실행할 수도 있고, “Try” 버튼을 클릭하여 테스트할 수도 있습니다.

reasoning_effort: max를 사용하여 얻은 실제 K3 응답입니다(사용하지 않은 확장 필드는 생략됨):
id, 이번 대화 작업을 생성한 ID로, 이번 대화 작업을 고유하게 식별하는 데 사용됩니다.model, 선택한 Kimi 공식 모델입니다.choices, Kimi가 질문에 대해 제공한 답변 정보입니다.usage: 이번 질문-답변 쌍에 대한 토큰 통계 정보입니다.
choices는 Kimi의 답변 정보를 포함하고 있으며, 그 안의 choices는 Kimi의 구체적인 답변 정보를 포함하고 있습니다. 아래 그림과 같이 확인할 수 있습니다.

choices 안의 content 필드에는 Kimi의 구체적인 답변 내용이 포함되어 있습니다. K3는 또한 추론 과정을 나타내기 위해 reasoning_content를 반환할 수 있습니다.
K3 추론 강도
kimi-k3는 항상 추론을 활성화합니다. 요청 본문의 최상위는 reasoning_effort 필드를 지원하며, 현재 유일하게 지원되는 값은 max입니다; 이 필드를 생략할 경우에도 max가 사용됩니다. standard, high 또는 기타 문자열은 일부 호환되는 상위에서 느슨하게 수용될 수 있지만, 추론 동작을 변경할 것이라는 보장은 없으므로 의존하지 마십시오.
messages에 다시 전달해야 하며, reasoning_content 및 tool_calls를 포함해야 합니다.
공식 참고
- Thinking Effort: Kimi K3가 항상 추론을 활성화하며, 현재
reasoning_effort의 유일한 지원 값이max임을 설명합니다. - Model Parameter Reference: K3와 K2 시리즈의 추론 매개변수, 컨텍스트 창 및 도구 호출 차이를 비교합니다.
- Create Chat Completion: Moonshot 공식 Chat Completions 요청, 응답 및 OpenAPI 필드 정의입니다.
스트리밍 응답
이 인터페이스는 스트리밍 응답도 지원하며, 이는 웹 페이지 통합에 매우 유용하여 웹 페이지에서 글자 단위로 표시하는 효과를 구현할 수 있습니다. 응답을 스트리밍으로 반환하려면 요청 헤더의stream 매개변수를 true로 변경하면 됩니다.
아래 그림과 같이 수정하되, 호출 코드는 스트리밍 응답을 지원하도록 적절한 변경이 필요합니다.

stream을 true로 변경하면 API는 해당 JSON 데이터를 줄 단위로 반환하며, 코드 측면에서 우리는 줄 단위 결과를 얻기 위해 적절한 수정을 해야 합니다.
Python 샘플 호출 코드:
data가 있으며, data 안의 choices는 최신의 답변 내용으로, 위에서 소개한 내용과 일치합니다. choices는 추가된 답변 내용이며, 결과에 따라 시스템에 연결할 수 있습니다. 또한 스트리밍 응답의 종료는 data의 내용을 기준으로 판단하며, 내용이 [DONE]일 경우 스트리밍 응답이 모두 종료되었음을 나타냅니다. 반환된 data 결과는 여러 필드를 포함하며, 설명은 다음과 같습니다:
id, 이번 대화 작업을 생성한 ID로, 이번 대화 작업을 고유하게 식별하는 데 사용됩니다.model, 선택한 Kimi 공식 모델입니다.choices, Kimi가 질문에 대해 제공한 답변 정보입니다.
다중 대화
여러 번의 대화 기능을 연결하려면messages 필드에 여러 질문을 업로드해야 하며, 여러 질문의 구체적인 예시는 아래 그림과 같습니다:

choices에 포함된 정보는 기본 사용 내용과 일치하며, 이는 Kimi가 여러 대화에 대해 응답한 구체적인 내용을 포함하고 있어, 여러 대화 내용을 기반으로 해당 질문에 답변할 수 있습니다.
오류 처리
API를 호출할 때 오류가 발생하면, API는 해당 오류 코드와 정보를 반환합니다. 예를 들어:400 token_mismatched: 잘못된 요청, 누락되었거나 잘못된 매개변수 때문일 수 있습니다.400 api_not_implemented: 잘못된 요청, 누락되었거나 잘못된 매개변수 때문일 수 있습니다.401 invalid_token: 인증되지 않음, 잘못되었거나 누락된 인증 토큰입니다.429 too_many_requests: 너무 많은 요청, 비율 제한을 초과했습니다.500 api_error: 내부 서버 오류, 서버에서 문제가 발생했습니다.
오류 응답 예시
결론
이 문서를 통해 Kimi Chat Completion API를 사용하여 일반 대화, 스트리밍 응답, 다중 대화 및reasoning_effort를 통해 K3의 추론 강도를 제어하는 방법을 이해하게 되었습니다.
