Kimi K3 · 1M Context · 实时更新

命令行AI编程工具下载Kimi Code 终端开发助手

兼容 OpenAI 与 Anthropic 协议,K2、K3 全系列模型开箱即用。1M token 长上下文、低延迟、企业级 SLA,开发者集成 Kimi 模型能力的最快方式。

99.95%
服务可用性
120ms
首 token 延迟
50K+
注册开发者
1M
最大上下文
POST /v1/chat/completions
200 OK
// 完全兼容 OpenAI Chat Completions 协议 const response = await fetch('https://api.kimi.com/v1/chat/completions', { method: 'POST', headers: { 'Authorization': 'Bearer sk-kimi-...', 'Content-Type': 'application/json' }, body: JSON.stringify({ model: "kimi-k3-1m", messages: [ { role: "system", content: "你是 Kimi" }, { role: "user", content: "用一句话介绍长上下文" } ], stream: true, temperature: 0.7 }) });

为什么开发者选择 Kimi API

为企业打造,为开发者友好——这就是 Kimi API 开放平台的承诺。

🔌

协议完全兼容

支持 OpenAI Chat Completions、Anthropic Messages、Function Calling、Tools Use,零迁移成本接入现有应用。

🚀

极速响应

国内多地域 BGP 节点 + 海外边缘加速,首 token 平均 120ms,长文本生成持续稳定。

📚

1M 超长上下文

K3 模型原生支持 100 万 token,可一次性处理整本技术手册、年度财报或整个代码仓库。

🛡️

企业级 SLA

99.95% 可用性承诺,私有部署、VPC 隔离、审计日志、SSO 单点登录满足合规要求。

🧰

丰富工具

内置代码解释器、文件读取、网页搜索、计算器等十余种 Tools,配合 Function Calling 自由编排。

💰

透明计费

按 token 计费,无最低消费,新用户赠送 100 万 token 体验金,后台实时查看用量与账单。

🎯

多模态

K3-Vision 支持图像理解、OCR、图表解析,可同时输入文本、图片、PDF、视频帧进行推理。

🌍

全球部署

国内华北、华东、华南三地域 + 新加坡、法兰克福、硅谷海外节点,自动就近接入。

强大的 模型矩阵

从轻量到旗舰,Kimi 提供覆盖全场景的模型组合,灵活计费满足不同业务。

推荐

Kimi K3

moonshot-v1-32k · 128k · 1m
  • 1M token 上下文,原生长文本推理
  • 多模态输入:文本 / 图片 / PDF
  • 更强中文理解与代码生成能力
  • 支持 Tool Use 与 Function Calling
¥0.012/千 token

Kimi K2.7

moonshot-v1-8k · 32k · 128k
  • 高性价比通用模型
  • 对话、写作、抽取、分类全能
  • 毫秒级响应适合实时业务
  • 支持流式输出与 JSON Mode
¥0.004/千 token

三行代码,接入 Kimi

OpenAI 官方 SDK 直接可用,无需任何 Kimi 专属依赖。

Python · OpenAI SDK

from openai import OpenAI

client = OpenAI(
    api_key="sk-kimi-...",
    base_url="https://api.kimi.com/v1"
)

resp = client.chat.completions.create(
    model="kimi-k3-1m",
    messages=[{"role":"user","content":"你好"}]
)
print(resp.choices[0].message.content)

Node.js · Anthropic SDK

import Anthropic from "@anthropic-ai/sdk";

const client = new Anthropic({
  apiKey: process.env.KIMI_KEY,
  baseURL: "https://api.kimi.com"
});

const msg = await client.messages.create({
  model: "kimi-k3",
  max_tokens: 1024,
  messages: [{ role: "user", content: "你好" }]
});
console.log(msg.content);

cURL · 原生 HTTP

curl https://api.kimi.com/v1/chat/completions \
  -H "Authorization: Bearer $KIMI_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "kimi-k3-1m",
    "messages": [
      {"role":"user","content":"Hello"}
    ]
  }'

Go · OpenAI Go SDK

import (
    "context"
    openai "github.com/sashabaranov/go-openai"
)

client := openai.NewClientWithConfig(
    openai.DefaultConfig("sk-kimi-..."),
)
client.BaseURL = "https://api.kimi.com/v1"

resp, _ := client.CreateChatCompletion(ctx,
    openai.ChatCompletionRequest{
        Model: "kimi-k3-1m",
        Messages: []openai.ChatCompletionMessage{
            {Role: "user", Content: "你好"},
        },
    })

常见问题 FAQ

集成 Kimi API 之前,你需要知道的都在这里。

Kimi API 是否完全兼容 OpenAI 协议?
Kimi API 在端点上完全兼容 OpenAI Chat Completions、Completions、Embeddings 规范,并兼容 Anthropic Messages 接口。你可以直接替换 base_url 使用官方 SDK,包括 OpenAI 官方库、LangChain、LlamaIndex、Semantic Kernel 等都无需改动即可调用 Kimi 模型,所有参数(temperature、top_p、stream、tools 等)按 OpenAI 标准工作。
如何申请 API Key?是否有免费额度?
注册 Moonshot AI 账号并在控制台完成实名认证后即可创建 API Key。新用户默认赠送 100 万 token 的体验额度,企业认证用户可申请更高的试用额度与并发上限。控制台提供完整的用量监控、配额告警、子账号管理与账单导出功能。
K3 模型的 1M 上下文怎么计费?
K3 模型的计费按实际输入 + 输出 token 数计算,与上下文长度无关。无论你使用 8k、32k、128k 还是 1m 窗口,输入价格一致,但更大的窗口能让你一次性塞入更多内容,从而避免切片带来的语义损失与重复计费,整体反而更经济。
流式输出(SSE)支持哪些客户端?
所有模型均支持 Server-Sent Events 流式输出,OpenAI 与 Anthropic SDK 的 stream 参数直接生效。你也可以用 EventSource、Fetch + ReadableStream、Axios stream、自定义 HTTP 客户端接收增量数据,适合实时对话、长文本生成、代码补全等场景。
Function Calling 与 Tools 的差异?
Function Calling 与 OpenAI 协议一致,通过 tools 字段声明函数 schema,模型决定何时调用。你也可以使用 Anthropic 风格的 input_schema,或者直接启用 Kimi 内置工具:网页搜索、文件读取、代码解释器、计算器、图像理解等,工具调用结果会自动注入到下一次推理中。
数据安全与合规如何保障?
Kimi API 通过 ISO 27001、等保三级、可信云认证,所有数据传输使用 TLS 1.3 加密,存储使用 AES-256。企业版可选择数据不出域:私有化部署、VPC 独占实例、数据脱敏、prompt/response 双向审计,敏感行业(金融、医疗、政企)有专门的合规方案与技术支持团队。
是否支持 fine-tune 与 LoRA?
K2 系列模型开放 fine-tune 接口,企业客户可以基于自有数据微调专属模型并部署到独立推理节点,支持 LoRA、全参数微调、DPO、RLHF 等训练方式。训练数据可由客户提供或由 Kimi 数据团队协助标注,整个流程在私有环境完成,不进入公共模型训练。
遇到限流(429)怎么办?
默认每分钟 60 次请求、每分钟 60K token 的软限制,触发后返回 429 并附带 retry-after 头。Pro 与 Enterprise 用户可申请更高的 RPS 与 TPM 上限。我们推荐使用指数退避策略自动重试,并启用 SDK 内置的限流器批量分发请求,企业用户还可以使用 Batch API 异步处理大批量任务以降低成本。