Skip to main content
Kimi to seria modeli AI wprowadzona przez Mroczną Stronę Księżyca. Obecnie zalecany kimi-k3 jest skierowany na długozasięgowe programowanie, agentów, złożone rozumowanie i pracę z wiedzą, i można go wywołać za pomocą zgodnego z OpenAI API Chat Completions. Dokument ten głównie opisuje proces korzystania z Kimi Chat Completion API, dzięki któremu możemy łatwo korzystać z funkcji rozmowy oficjalnego Kimi.

申请流程

Aby korzystać z Kimi Chat Completion API, najpierw przejdź do Ace Data Cloud 控制台, aby uzyskać swój token API, który należy zachować na przyszłość. Jeśli nie jesteś zalogowany lub zarejestrowany, automatycznie zostaniesz przekierowany na stronę logowania, aby zarejestrować się i zalogować, a po zakończeniu zostaniesz automatycznie przekierowany z powrotem na bieżącą stronę. Jeden token API wystarczy do wywołania wszystkich usług platformy, nie ma potrzeby składania osobnych wniosków dla każdej usługi. Przy pierwszym wniosku otrzymasz darmowy limit, aby móc korzystać z usługi za darmo; gdy limit się wyczerpie, możesz doładować saldo ogólne w 控制台.
📘 Pełna dokumentacja: Kimi Chat Completion API →

基本使用

Następnie możesz wypełnić odpowiednie treści na interfejsie, jak pokazano na obrazku:

Podczas pierwszego korzystania z tego interfejsu musisz wypełnić co najmniej trzy pola: authorization, które można bezpośrednio wybrać z rozwijanej listy; model, aby wybrać model Kimi, zaleca się użycie kimi-k3; messages to tablica wiadomości rozmowy, gdzie każda wiadomość zawiera role i content, przy czym role obsługuje user, assistant, system i tool. Możesz również zauważyć, że po prawej stronie generowany jest odpowiedni kod wywołania, który możesz skopiować i uruchomić, lub możesz bezpośrednio kliknąć przycisk „Try”, aby przetestować.

Poniżej znajduje się rzeczywista odpowiedź K3 uzyskana przy użyciu reasoning_effort: max (pominięto nieużywane pola rozszerzeń):
Zwrócone wyniki zawierają wiele pól, które są opisane poniżej:
  • id, identyfikator generowanego zadania rozmowy, używany do unikalnej identyfikacji tego zadania rozmowy.
  • model, wybrany model Kimi z oficjalnej strony.
  • choices, informacje o odpowiedzi Kimi na zadane pytanie.
  • usage: statystyki dotyczące tokenów dla tej pary pytań i odpowiedzi.
Wśród nich choices zawiera informacje o odpowiedzi Kimi, a wewnątrz choices znajdują się konkretne informacje o odpowiedzi Kimi, co można zobaczyć na obrazku.

Można zauważyć, że pole content w choices zawiera konkretne treści odpowiedzi Kimi; K3 może również zwrócić reasoning_content, aby wskazać proces rozumowania.

K3 推理强度

kimi-k3 zawsze włącza rozumowanie. Najwyższy poziom żądania obsługuje pole reasoning_effort, a jedyną obsługiwaną wartością jest max; pominięcie tego pola również skutkuje użyciem max. standard, high lub inne ciągi mogą być częściowo akceptowane przez luźniejsze upstream, ale nie gwarantują zmiany zachowania rozumowania, nie polegaj na tym.
Podczas korzystania z OpenAI SDK można bezpośrednio przekazać to pole:
W przypadku wieloetapowych rozmów i wywołań narzędzi należy przekazać pełną wiadomość asystenta z poprzedniej rundy do messages, w tym reasoning_content i tool_calls.

官方参考

  • Thinking Effort:wyjaśnia, że Kimi K3 zawsze włącza rozumowanie, a jedyną obsługiwaną wartością reasoning_effort jest max.
  • Model Parameter Reference:porównuje parametry rozumowania K3 i K2, okna kontekstowe oraz różnice w wywołaniach narzędzi.
  • Create Chat Completion:oficjalne żądania, odpowiedzi i definicje pól OpenAPI dla Chat Completions Moonshot.

流式响应

Ten interfejs obsługuje również odpowiedzi strumieniowe, co jest bardzo przydatne w integracji z witrynami internetowymi, umożliwiając wyświetlanie efektu literowego. Jeśli chcesz, aby odpowiedź była zwracana strumieniowo, możesz zmienić parametr stream w nagłówku żądania na true. Zmiana jak na obrazku, ale kod wywołania musi być odpowiednio zmieniony, aby obsługiwał odpowiedzi strumieniowe.

Po zmianie stream na true, API zwróci odpowiednie dane JSON w wierszach, a na poziomie kodu musimy wprowadzić odpowiednie zmiany, aby uzyskać wyniki w wierszach. Przykładowy kod wywołania w Pythonie:
Poniżej przedstawiono fragmenty z rzeczywistej odpowiedzi strumieniowej K3 Max, w tym bloki danych początkowych, rozumowania, treści, zakończenia i użycia:
Można zauważyć, że odpowiedź zawiera wiele data, a data wewnątrz choices to najnowsza treść odpowiedzi, zgodna z wcześniej przedstawioną treścią. choices to nowa treść odpowiedzi, którą można zintegrować z systemem. Zakończenie strumieniowej odpowiedzi jest określane na podstawie zawartości data, a jeśli zawartość to [DONE], oznacza to, że strumieniowa odpowiedź została całkowicie zakończona. Zwracane wyniki data mają wiele pól, które są opisane poniżej:
  • id, identyfikator generowanego zadania rozmowy, używany do unikalnej identyfikacji tego zadania rozmowy.
  • model, wybrany model z oficjalnej strony Kimi.
  • choices, informacje o odpowiedziach udzielonych przez Kimi na pytania.
JavaScript jest również obsługiwany, na przykład kod do strumieniowego wywołania w Node.js wygląda następująco:
Przykładowy kod w Javie:
Inne języki można dostosować samodzielnie, zasada jest taka sama.

Wieloetapowa rozmowa

Jeśli chcesz zintegrować funkcję wieloetapowej rozmowy, musisz przesłać wiele pytań w polu messages, a konkretne przykłady wielu pytań są pokazane na poniższym obrazku:

Przykładowy kod wywołania w Pythonie:
Przesyłając wiele pytań, można łatwo zrealizować wieloetapową rozmowę. Poniżej znajduje się rzeczywista odpowiedź K3 Max uzyskana z tego żądania (pomijając nieużywane pola rozszerzeń):
Można zauważyć, że informacje zawarte w choices są zgodne z podstawowym użyciem, zawierają konkretne treści odpowiedzi Kimi na wiele rozmów, co pozwala na odpowiadanie na odpowiednie pytania na podstawie wielu treści rozmowy.

Obsługa błędów

Podczas wywoływania API, jeśli wystąpią błędy, API zwróci odpowiednie kody błędów i informacje. Na przykład:
  • 400 token_mismatched: Zły wniosek, prawdopodobnie z powodu brakujących lub nieprawidłowych parametrów.
  • 400 api_not_implemented: Zły wniosek, prawdopodobnie z powodu brakujących lub nieprawidłowych parametrów.
  • 401 invalid_token: Nieautoryzowany, nieprawidłowy lub brakujący token autoryzacyjny.
  • 429 too_many_requests: Zbyt wiele żądań, przekroczono limit szybkości.
  • 500 api_error: Błąd wewnętrzny serwera, coś poszło nie tak na serwerze.

Przykład odpowiedzi błędu

Wnioski

Dzięki temu dokumentowi zrozumiałeś, jak używać Kimi Chat Completion API do realizacji zwykłych rozmów, strumieniowych odpowiedzi, wieloetapowych rozmów oraz jak kontrolować intensywność rozumowania K3 za pomocą reasoning_effort.