Skip to main content
Kimi är en AI-modellserie som lanserats av Månen av Mörka Sidan. Den nuvarande rekommenderade kimi-k3 är inriktad på långsiktig programmering, agenter, komplexa resonemang och kunskapsarbete, och kan anropas via OpenAI-kompatibel Chat Completions API. Detta dokument beskriver huvudsakligen användningsflödet för Kimi Chat Completion API, vilket gör att vi enkelt kan använda den officiella Kimi:s samtalsfunktion.

Ansökningsprocess

För att använda Kimi Chat Completion API, börja med att gå till Ace Data Cloud-konsolen för att hämta din API-token, som du ska spara för framtida bruk. Om du inte har loggat in eller registrerat dig, kommer du automatiskt att omdirigeras till inloggningssidan som bjuder in dig att registrera dig och logga in, och efter att ha slutfört detta kommer du automatiskt att återvända till den aktuella sidan. En API-token räcker för att anropa alla tjänster på plattformen, det behövs ingen separat ansökan för varje tjänst. Första ansökan ger en gratis kvot, så att du kan prova gratis; om kvoten tar slut kan du ladda på allmän balans i konsolen.
📘 Fullständig dokumentation: Kimi Chat Completion API →

Grundläggande Användning

Nu kan du fylla i motsvarande innehåll på gränssnittet, som visas i bilden:

Vid första användning av detta gränssnitt behöver du fylla i minst tre fält: authorization kan väljas direkt från rullgardinsmenyn; model används för att välja Kimi-modellen, rekommenderat att använda kimi-k3; messages är en array av samtalsmeddelanden, där varje meddelande innehåller role och content, där role stöder user, assistant, system och tool. Samtidigt kan du notera att det finns motsvarande anropskod som genereras till höger, du kan kopiera koden för att köra den direkt, eller klicka på “Try” knappen för att testa.

Nedan är en verklig K3-respons som erhållits med reasoning_effort: max (utökade fält som inte används har utelämnats):
Det returnerade resultatet har flera fält, som beskrivs nedan:
  • id, ID för att generera denna samtalsuppgift, används för att unikt identifiera denna samtalsuppgift.
  • model, den valda Kimi-modellen från hemsidan.
  • choices, Kimi:s svarsinformation på frågan.
  • usage: statistik över token för denna fråge- och svarsinteraktion.
Där choices innehåller Kimi:s svarsinformation, och choices inuti det är den specifika informationen som Kimi svarade med, vilket kan ses i bilden.

Det kan ses att content-fältet i choices innehåller det specifika innehållet i Kimi:s svar; K3 kan också returnera reasoning_content, som används för att representera resonemangsprocessen.

K3 Resonemang Intensitet

kimi-k3 har alltid aktiverat resonemang. Den översta nivån av begäran stöder fältet reasoning_effort, det nuvarande enda stödda värdet är max; om detta fält utelämnas används också max. standard, high eller andra strängar kan delvis accepteras av upstream-lösningar, men det garanterar inte att resonemangsbeteendet ändras, så förlita dig inte på det.
Vid användning av OpenAI SDK kan detta fält överföras direkt:
Vid fleromgångssamtal och verktygsanrop, vänligen skicka tillbaka hela föregående assistentmeddelande till messages, inklusive reasoning_content och tool_calls.

Officiell Referens

  • Thinking Effort: Förklarar att Kimi K3 alltid har aktiverat resonemang, det nuvarande enda stödda värdet för reasoning_effort är max.
  • Model Parameter Reference: Jämför resonansparametrar, kontextfönster och skillnader i verktygsanrop mellan K3 och K2-serien.
  • Create Chat Completion: Moonshot officiella Chat Completions begäran, svar och OpenAPI fältdokumentation.

Strömmande Respons

Detta gränssnitt stöder också strömmande respons, vilket är mycket användbart för webbgränssnitt, eftersom det kan ge en tecken-för-tecken visningseffekt. Om du vill ha en strömmande respons kan du ändra stream-parametern i begärans huvud till true. Ändringen visas i bilden, men anropskoden behöver ha motsvarande ändringar för att stödja strömmande respons.

När stream ändras till true, kommer API:t att returnera motsvarande JSON-data rad för rad, och på kodnivå behöver vi göra nödvändiga ändringar för att få rad-för-rad resultat. Python exempel på anropskod:
Nedan är ett utdrag från en verklig K3 Max strömmande respons som innehåller start-, resonemangs-, text-, slut- och användningsdatablock:
Det kan ses att svaret innehåller många data, där data inuti choices är det senaste svaret, vilket överensstämmer med den tidigare beskrivna informationen. choices är det nya svaret, och du kan koppla det till ditt system baserat på resultatet. Samtidigt är slutet på den strömmande svaret baserat på innehållet i data, om innehållet är [DONE], indikerar det att det strömmande svaret har avslutats helt. De returnerade data-resultaten har flera fält, som beskrivs nedan:
  • id, ID för att generera denna dialoguppgift, används för att unikt identifiera denna dialoguppgift.
  • model, den valda Kimi-webbplatsmodellen.
  • choices, Kimi:s svarsinformation på frågeordet.
JavaScript stöds också, till exempel Node.js:s strömmande anropskod ser ut så här:
Java-exempel på kod:
Andra språk kan skrivas om på egen hand, principen är densamma.

Flera rundor av dialog

Om du vill koppla fler rundor av dialogfunktionalitet, behöver du ladda upp flera frågeord i messages-fältet, specifika exempel på flera frågeord visas nedan:

Python-exempel på anropskod:
Genom att ladda upp flera frågeord kan du enkelt uppnå flera rundor av dialog. Här är det verkliga svaret från K3 Max som erhölls från denna begäran (utelämnar oanvända utvidgningsfält):
Det kan ses att choices innehåller information som är i linje med den grundläggande användningen, detta innehåller Kimi:s specifika innehåll för att svara på flera dialoger, så att du kan svara på motsvarande frågor baserat på flera dialoginnehåll.

Felhantering

När du anropar API:et, om du stöter på fel, kommer API:et att returnera motsvarande felkod och information. Till exempel:
  • 400 token_mismatched: Dålig begäran, möjligtvis på grund av saknade eller ogiltiga parametrar.
  • 400 api_not_implemented: Dålig begäran, möjligtvis på grund av saknade eller ogiltiga parametrar.
  • 401 invalid_token: Obefogad, ogiltig eller saknad auktoriseringstoken.
  • 429 too_many_requests: För många begärningar, du har överskridit hastighetsgränsen.
  • 500 api_error: Internt serverfel, något gick fel på servern.

Exempel på felrespons

Slutsats

Genom detta dokument har du fått en förståelse för hur du använder Kimi Chat Completion API för att genomföra vanliga dialoger, strömmande svar, flera rundor av dialog, samt hur du kontrollerar K3:s resonemangsstyrka genom reasoning_effort.