Thinking Machines Lab はオープンウェイトの基盤モデル Inkling を公開した。Mixture-of-Experts のトランスフォーマーで総パラメータ 975B・活性 41B、コンテキストは最大 100 万トークンである。テキスト・画像・音声をネイティブに扱い、思考努力を制御してコストと性能のバランスを取れる。ライセンスは Apache 2.0 で、重みは Hugging Face から配布し、Tinker での fine-tune も同日利用できる。横断的な第三者性能指数への掲載はなく、評価はベンダー公表のベンチマークに依る。

概要は次のとおり。

  • 事前学習はテキスト・画像・音声・動画を含む 45 兆トークン
  • 家族として活性 12B の Inkling-Small(プレビュー)も示し、完全な重み公開はテスト完了後
  • Tinker ではコンテキスト 64K / 256K を提供し、期間限定で 50% 割引
  • 推論は Together AI、Fireworks、Modal、Databricks、Baseten 等の API や、SGLang・vLLM・llama.cpp 等でも利用できる

BF16 チェックポイントは集約 VRAM 2 TB 以上(例: 8x B300 または 16x H200)、NVFP4 は 600 GB 以上が目安である。

#評価(ベンダー)

effort=0.99 での公表値の一部は次のとおり。

指標InklingNemotron 3 UltraKimi K2.6
HLE(text only)29.7%26.6%35.9%
SWE-Bench Verified77.6%70.7%80.2%
Terminal Bench 2.163.8%56.4%71.3%
MMMU Pro(Standard 10)73.5%79.0%
VoiceBench91.4%
FORTRESS(Adversarial)78.0%77.6%65.6%

ベンダーは最強モデルではなく、マルチモーダルと効率的な思考、Tinker 上のカスタマイズ適性を備えた基盤として位置づけている。Inkling-Small は多くの指標で Inkling に近い成績を示す。

#API 価格の比較

Tinker 上の従量単価(100 万トークンあたり。Inkling と Nemotron-3-Ultra は期間限定 50% 割引後の掲載値。Prefill のキャッシュヒットはさらに 80% 割引)は次のとおり。

モデルPrefill ($/1M)Sample ($/1M)Train ($/1M)
Inkling(64K)1.874.685.61
Nemotron-3-Ultra(64K)2.496.2255.478
Kimi-K2.6(32K)2.2055.494.84

割引適用後の Inkling は Prefill・Sample で Nemotron-3-Ultra より安く、Train は近い水準である。

#参考文献