Skip to main content
Kimi är en AI-modellserie som lanserats av Månen av Mörka Sidan. Den nuvarande rekommenderade kimi-k3 är inriktad på långsiktig programmering, agenter, komplexa resonemang och kunskapsarbete, och kan anropas via OpenAI-kompatibel Chat Completions API. Detta dokument beskriver huvudsakligen användningsflödet för Kimi Chat Completion API, vilket gör att vi enkelt kan använda den officiella Kimi:s samtalsfunktion.

Ansökningsprocess

För att använda Kimi Chat Completion API, börja med att gå till Ace Data Cloud-konsolen för att hämta din API-token, som du ska spara för framtida bruk. Om du inte har loggat in eller registrerat dig, kommer du automatiskt att omdirigeras till inloggningssidan där du uppmanas att registrera dig och logga in, och efter att ha slutfört detta kommer du automatiskt att återvända till den aktuella sidan. En API-token räcker för att anropa alla tjänster på plattformen, det behövs ingen separat ansökan för varje tjänst. Vid första ansökan får du en gratis kvot för att prova; om kvoten tar slut kan du ladda på allmän balans i konsolen.
📘 Fullständig dokumentation: Kimi Chat Completion API →

Grundläggande Användning

Nu kan du fylla i motsvarande innehåll på gränssnittet, som visas i bilden:

Vid första användningen av detta gränssnitt behöver du fylla i minst tre fält: authorization kan väljas direkt från rullgardinsmenyn; model används för att välja Kimi-modellen, rekommenderat att använda kimi-k3; messages är en array av samtalsmeddelanden, där varje meddelande innehåller role och content, där role stöder user, assistant, system och tool. Samtidigt kan du notera att det finns motsvarande anropskod som genereras till höger, du kan kopiera koden för att köra den direkt, eller klicka på “Try” knappen för att testa.

Nedan är en verklig K3-respons som erhållits med reasoning_effort: max (utökade fält som inte används har utelämnats):
Det returnerade resultatet har flera fält, som beskrivs nedan:
  • id, ID för att generera denna samtalsuppgift, används för att unikt identifiera denna samtalsuppgift.
  • model, den valda Kimi-modellen från hemsidan.
  • choices, Kimi:s svarsinformation på frågan.
  • usage: statistik över token för denna frågeställning.
Där choices innehåller Kimi:s svarsinformation, och choices inuti det är den specifika informationen om Kimi:s svar, vilket kan ses i bilden.

Det kan ses att content-fältet i choices innehåller det specifika innehållet i Kimi:s svar; K3 kan också returnera reasoning_content, som används för att representera resonemangsprocessen.

K3 Resonemang Intensitet

kimi-k3 har alltid aktiverat resonemang. Den översta nivån av begäran stöder fältet reasoning_effort, det nuvarande enda stödda värdet är max; om detta fält utelämnas används också max. standard, high eller andra strängar kan delvis accepteras av kompatibla upstream-system, men det garanterar inte att resonemangsbeteendet ändras, så förlita dig inte på det.
När du använder OpenAI SDK kan du direkt skicka detta fält:
Vid fleromgångssamtal och verktygsanrop, vänligen skicka tillbaka hela föregående assistentmeddelande till messages, inklusive reasoning_content och tool_calls.

Officiell Referens

  • Thinking Effort: Förklarar att Kimi K3 alltid har aktiverat resonemang, det nuvarande enda stödda värdet för reasoning_effort är max.
  • Model Parameter Reference: Jämför K3 med K2-seriens resonemangsparametrar, kontextfönster och verktygsanropsskillnader.
  • Create Chat Completion: Moonshot officiella Chat Completions begäran, svar och OpenAPI fältdokumentation.

Strömmande Respons

Detta gränssnitt stöder också strömmande respons, vilket är mycket användbart för webbgränssnitt, och kan ge en tecken-för-tecken visningseffekt. Om du vill ha en strömmande respons kan du ändra stream-parametern i begärans huvud till true. Ändringen visas i bilden, men anropskoden behöver ha motsvarande ändringar för att stödja strömmande respons.

När stream ändras till true, kommer API:t att returnera motsvarande JSON-data rad för rad, och på kodnivå behöver vi göra nödvändiga ändringar för att få rad-för-rad resultat. Python exempel på anropskod:
Nedan är ett utdrag från en verklig K3 Max strömmande respons som innehåller start-, resonemangs-, text-, slut- och användningsdatablock:
Det kan ses att svaret innehåller många data, där data inuti choices är det senaste svaret, vilket överensstämmer med den tidigare beskrivna informationen. choices är det nya svaret, och du kan koppla det till ditt system baserat på resultatet. Samtidigt är slutet på den strömmande svaret baserat på innehållet i data, om innehållet är [DONE], indikerar det att det strömmande svaret har avslutats helt. De returnerade data-resultaten har flera fält, som beskrivs nedan:
  • id, ID för att generera denna dialoguppgift, används för att unikt identifiera denna dialoguppgift.
  • model, den valda Kimi-webbplatsmodellen.
  • choices, Kimi:s svarsinformation på frågorna.
JavaScript stöds också, till exempel Node.js:s strömmande anropskod ser ut så här:
Java-exempel på kod:
Andra språk kan skrivas om på egen hand, principen är densamma.

Flera rundor av dialog

Om du vill koppla till funktionen för flera rundor av dialog, behöver du ladda upp flera frågor i messages-fältet, specifika exempel på flera frågor visas nedan:

Python-exempel på anropskod:
Genom att ladda upp flera frågor kan du enkelt uppnå flera rundor av dialog. Här är det verkliga svaret från K3 Max som erhölls från denna begäran (utelämnar oanvända utvidgningsfält):
Det kan ses att informationen i choices är densamma som den grundläggande användningen, vilket innehåller Kimi:s specifika svar på flera dialoger, så att du kan svara på motsvarande frågor baserat på flera dialoginnehåll.

Felhantering

När du anropar API:et, om du stöter på fel, kommer API:et att returnera motsvarande felkod och information. Till exempel:
  • 400 token_mismatched: Felaktig begäran, möjligtvis på grund av saknade eller ogiltiga parametrar.
  • 400 api_not_implemented: Felaktig begäran, möjligtvis på grund av saknade eller ogiltiga parametrar.
  • 401 invalid_token: Obefogad, ogiltig eller saknad auktoriseringstoken.
  • 429 too_many_requests: För många begärningar, du har överskridit hastighetsgränsen.
  • 500 api_error: Internt serverfel, något gick fel på servern.

Exempel på felrespons

Slutsats

Genom detta dokument har du fått en förståelse för hur du använder Kimi Chat Completion API för att genomföra vanliga dialoger, strömmande svar, flera rundor av dialog, samt hur du kontrollerar K3:s resonemangsstyrka genom reasoning_effort.