Kimi K2.7 Code API 2026: новая coding-модель Moonshot, бенчмарки, цены и CodeFast
Moonshot AI выпустила Kimi K2.7 Code как открытую модель и API. В гайде разобраны 256K context, preserve_thinking, MCP-бенчмарки, официальные цены и актуальный доступ к K2.7 Code через баланс CodeFast.
· CodeFast Team
Что такое Kimi K2.7 Code?
Moonshot AI (Kimi) анонсировала Kimi K2.7 Code утром 12 июня 2026 года как open source и API. Модель — coding-focused agentic model на базе Kimi K2.6, оптимизированная для long-horizon software engineering workflows, tool calling, MCP integrations и end-to-end coding tasks, а не для general chat. Она опубликована на HuggingFace как `moonshotai/Kimi-K2.7-Code` и доступна через официальный API с model ID `kimi-k2.7-code` на platform.moonshot.ai.
В центре анонса три тезиса: (1) двузначный рост над K2.6 в coding и agent benchmarks, (2) примерно на 30% меньше thinking token usage — меньше overthinking, более эффективный reasoning, (3) улучшенный instruction following и end-to-end success в long-horizon coding tasks. Moonshot также отметила, что 6x High-Speed Mode скоро появится.
Kimi K2.7 Code snapshot - June 12, 2026
Model ID (API): kimi-k2.7-code
HuggingFace: moonshotai/Kimi-K2.7-Code
License: Modified MIT
Architecture: Mixture-of-Experts (MoE)
Total parameters: 1T | Activated: 32B
Layers: 61 (1 dense) | Experts: 384 (8 selected per token)
Context length: 256K (262,144 tokens in API)
Vision encoder: MoonViT (400M params)
Inputs: text, image, video
Modes: thinking (forced), preserve_thinking (forced)
Instant mode: not supported
Recommended: temperature 1.0, top_p 0.95
Inference engines: vLLM, SGLang, KTransformers
Технический snapshot Kimi K2.7 Code на 12 июня 2026
Ключевые моменты анонса 12 июня 2026
- Open source: model weights и code repository опубликованы на HuggingFace под Modified MIT License.
- Официальный API: доступ через model ID `kimi-k2.7-code` на platform.moonshot.ai и kimi.com/code.
- Рост бенчмарков над K2.6: Kimi Code Bench v2 +21.8%, Program Bench +11.0%, MLS Bench Lite +31.5%.
- Reasoning efficiency: примерно на 30% меньше thinking token usage по сравнению с K2.6.
- Скоро: 6x High-Speed Mode для более быстрого inference.
Архитектура и технические характеристики
Kimi K2.7 Code использует ту же core architecture, что K2.5/K2.6, поэтому существующие deployment guides можно переиспользовать напрямую. Это MoE-модель с 1T total parameters и 32B activated parameters per token. Предлагает 256K context window, 61 layers (1 dense), 384 experts (8 selected per token), MLA (Multi-head Latent Attention) и 160K vocabulary. Поддерживается native INT4 quantization — важное cost advantage для self-hosting.
В multimodal части MoonViT vision encoder (400M parameters) поддерживает text, image и video input. Video input сейчас доступен в official API; в third-party vLLM/SGLang deployments video пока experimental. Thinking mode обязателен и не отключается; instant mode не поддерживается.
Результаты бенчмарков: coding и agentic performance
В официальных оценках Moonshot K2.7 Code опережает K2.6 во всех coding и agentic benchmark categories. По сравнению с closed models вроде GPT-5.5 и Claude Opus 4.8 есть области, где модель еще отстает, но среди coding-focused open-source моделей она одна из сильнейших.
Benchmark comparison - June 2026
K2.6 K2.7 Code GPT-5.5 Opus 4.8
--- Coding ---
Kimi Code Bench v2 50.9 62.0 69.0 67.4
Program Bench 48.3 53.6 69.1 63.8
MLS Bench Lite 26.7 35.1 35.5 42.8
--- Agentic ---
Kimi Claw 24/7 Bench 42.9 46.9 52.8 50.4
MCP Atlas 69.4 76.0 79.4 81.3
MCP Mark Verified 72.8 81.1 92.9 76.4
K2.7 Code vs K2.6 gains:
Kimi Code Bench v2: +21.8% | Program Bench: +11.0% | MLS Bench Lite: +31.5%
MCP Atlas: +9.5% | MCP Mark Verified: +11.4% | Kimi Claw 24/7: +9.3%
Официальное сравнение бенчмарков (Moonshot AI, июнь 2026)
- Kimi Code Bench v2: in-house benchmark на 10+ programming languages, production tech stacks и real-world software engineering tasks.
- Program Bench: пересборка программ с нуля только по compiled binary и documentation — 200 tasks, 248,000+ fuzz tests.
- MCP Mark Verified: оценка MCP tool-use в Notion, GitHub, Filesystem, Postgres и Playwright environments.
Kimi K2.7 Code vs Kimi K2.6: что изменилось?
K2.7 Code — переход от general-purpose multimodal agent model K2.6 к coding-specialized variant. Сохраняются та же 1T MoE architecture и 256K context, но training и inference optimizations направлены на coding workflows. Самые заметные отличия: thinking token efficiency, обязательный preserve_thinking и скачок в MCP/agent benchmarks.
K2.7 Code vs K2.6 - June 12, 2026
Feature K2.6 K2.7 Code
Model ID kimi-k2.6 kimi-k2.7-code
Focus general multimodal coding-focused agentic
Thinking mode optional forced (always on)
Preserve thinking optional forced (always on)
Instant mode supported not supported
Thinking token usage baseline ~30% lower
Open source weights yes yes (new release)
Kimi Code CLI supported optimized (recommended)
Official input price $0.95 / 1M tokens $0.95 / 1M tokens
Official output price $4.00 / 1M tokens $4.00 / 1M tokens
Сводка сравнения K2.7 Code vs K2.6
Ключевые возможности: preserve_thinking, interleaved thinking и multimodal
Самая важная coding-функция K2.7 Code — обязательный режим `preserve_thinking`. Он сохраняет полный reasoning content в multi-turn interactions и улучшает performance в coding agent scenarios. Его нельзя отключить, он включен по умолчанию. Дизайн Interleaved Thinking и Multi-Step Tool Call такой же, как у K2 Thinking — модель может чередовать thinking и tool calls.
- Preserve thinking: reasoning_content предыдущего turn хранится в assistant message; модель использует этот context в следующем turn.
- Interleaved thinking: thinking и tool call steps чередуются для более связного progress в long agent flows.
- Multimodal input: coding decisions с screenshots, design mockups, video demos или documentation images.
- ToolCalls, JSON Mode, Partial Mode и automatic context caching поддерживаются в official API.
Официальные цены API
Официальные цены Kimi K2.7 Code совпадают с K2.6: input $0.95/1M tokens (cache miss), $0.19/1M tokens (cache hit), output $4.00/1M tokens. Context window — 262,144 tokens. Как coding model, thinking tokens тоже тарифицируются по output pricing — поэтому снижение thinking tokens на 30% напрямую дает cost savings.
Kimi K2.7 Code API pricing - June 12, 2026
Model: kimi-k2.7-code
Input (cache hit): $0.19 / 1M tokens
Input (cache miss): $0.95 / 1M tokens
Output: $4.00 / 1M tokens
Context window: 262,144 tokens
API base URL: https://api.moonshot.ai/v1
Platform: https://platform.moonshot.ai
Kimi Code CLI: https://www.kimi.com/code
Официальная таблица цен Kimi K2.7 Code API
Как использовать official API
K2.7 Code работает с OpenAI SDK-compatible API format. Поскольку thinking mode обязателен, в response есть поле `reasoning`. Рекомендуются temperature 1.0 и top_p 0.95. Для preserve thinking добавляйте `reasoning_content` в assistant message; иначе multi-turn agent flows теряют context.
import openai
client = openai.OpenAI(
api_key="your_moonshot_api_key",
base_url="https://api.moonshot.ai/v1"
)
response = client.chat.completions.create(
model="kimi-k2.7-code",
messages=[
{"role": "system", "content": "You are Kimi, a coding AI assistant."},
{"role": "user", "content": "Refactor this module to use async/await."}
],
max_tokens=4096,
temperature=1.0,
top_p=0.95
)
print(response.choices[0].message.reasoning) # thinking content
print(response.choices[0].message.content) # final answer
Пример Kimi K2.7 Code с OpenAI SDK
Kimi Code CLI: рекомендуемый agent framework
Moonshot прямо указывает, что K2.7 Code лучше всего работает с Kimi Code CLI. Доступен на kimi.com/code, этот CLI дает agent harness, оптимизированный для preserve_thinking, interleaved tool calls и long-horizon coding tasks. Если вы используете Cursor, Windsurf или свою IDE-интеграцию, модель также работает через OpenAI-compatible endpoints; но official recommendation — Kimi Code CLI.
Open source и self-hosting
Model weights K2.7 Code опубликованы на HuggingFace в Safetensors format (1.1T params, BF16/F32/I32). И code repository, и model weights доступны под Modified MIT License. Для deployment рекомендуются vLLM, SGLang или KTransformers; deployment guide K2.5/K2.6 применяется напрямую. Требуется transformers >=4.57.1, <5.0.0. Native INT4 quantization снижает inference cost.
- HuggingFace: moonshotai/Kimi-K2.7-Code
- GitHub: moonshotai/kimi-k2 (репозиторий model family)
- Deployment guide: docs/deploy_guidance.md в HuggingFace repo
Kimi K2.7 Code в CodeFast: актуальный доступ
Kimi K2.7 Code теперь доступен в CodeFast как API-пакет с оплатой по балансу. Можно выбрать баланс от 50 до 5000 TRY и использовать форматы chat/completions или Messages. Идентификатор модели — `kimi-k2.7-code`; входные, выходные, записанные в кэш и прочитанные из кэша токены списываются по единой ставке CodeFast $0.108 за 1M токенов.
Provider: CodeFast Kimi K2.7 Code API
OpenAI-compatible Base URL: https://api.codefast.app/kimi-k2-7-code-api/v1
Anthropic messages endpoint: https://api.codefast.app/kimi-k2-7-code-api/v1/messages
Model: kimi-k2.7-code
Balance: selectable from 50 TRY to 5000 TRY
CodeFast rate: $0.108 per 1M input, output, cache-write, or cache-read tokens
CodeFast Kimi K2.7 Code API — актуальные эндпоинты
Кому это подходит?
Правильная рамка для K2.7 Code — не generic chat bot, а coding agent, который производит technical work. Модель создана для long refactors, multi-file migrations, MCP-based tool orchestration, rebuilding programs from binaries и technical decision processes с multimodal input. Для short classification или simple rewrite tasks легкие модели могут быть экономичнее.
Choose Kimi K2.7 Code when:
- The task spans many files, steps, or MCP tool calls
- You need preserve_thinking across multi-turn agent flows
- The prompt includes screenshots, video, or design context
- You want an open-source coding model with strong MCP benchmarks
- Token efficiency matters (30% lower thinking tokens vs K2.6)
Choose a lighter or free model when:
- The task is short classification or simple rewriting
- Instant, non-thinking responses matter more than long-horizon reasoning
- You want to prototype through the free NVIDIA API package first
- General chat is the primary use case
Практичная логика выбора
Вывод: Kimi K2.7 Code лидирует в волне coding agent 2026
Kimi K2.7 Code — сильная агентная модель для длинных задач программирования с открытыми весами, preserve_thinking и улучшенным MCP tool-use. Пакет CodeFast с оплатой по балансу дает доступ из клиентов, совместимых с OpenAI и Anthropic, с выбираемым бюджетом и прозрачной ценой токенов. Актуальные ставки, идентификатор модели и эндпоинты смотрите на странице пакета.