Thinking Machines Lab はオープンウェイトの基盤モデル Inkling を公開した。Mixture-of-Experts のトランスフォーマーで総パラメータ 975B・活性 41B、コンテキストは最大 100 万トークンである。テキスト・画像・音声をネイティブに扱い、思考努力を制御してコストと性能のバランスを取れる。ライセンスは Apache 2.0 で、重みは Hugging Face から配布し、Tinker での fine-tune も同日利用できる。横断的な第三者性能指数への掲載はなく、評価はベンダー公表のベンチマークに依る。
概要は次のとおり。
- 事前学習はテキスト・画像・音声・動画を含む 45 兆トークン
- 家族として活性 12B の Inkling-Small(プレビュー)も示し、完全な重み公開はテスト完了後
- Tinker ではコンテキスト 64K / 256K を提供し、期間限定で 50% 割引
- 推論は Together AI、Fireworks、Modal、Databricks、Baseten 等の API や、SGLang・vLLM・llama.cpp 等でも利用できる
BF16 チェックポイントは集約 VRAM 2 TB 以上(例: 8x B300 または 16x H200)、NVFP4 は 600 GB 以上が目安である。
評価(ベンダー)
effort=0.99 での公表値の一部は次のとおり。
| 指標 | Inkling | Nemotron 3 Ultra | Kimi K2.6 |
|---|---|---|---|
| HLE(text only) | 29.7% | 26.6% | 35.9% |
| SWE-Bench Verified | 77.6% | 70.7% | 80.2% |
| Terminal Bench 2.1 | 63.8% | 56.4% | 71.3% |
| MMMU Pro(Standard 10) | 73.5% | – | 79.0% |
| VoiceBench | 91.4% | – | – |
| FORTRESS(Adversarial) | 78.0% | 77.6% | 65.6% |
ベンダーは最強モデルではなく、マルチモーダルと効率的な思考、Tinker 上のカスタマイズ適性を備えた基盤として位置づけている。Inkling-Small は多くの指標で Inkling に近い成績を示す。
API 価格の比較
Tinker 上の従量単価(100 万トークンあたり。Inkling と Nemotron-3-Ultra は期間限定 50% 割引後の掲載値。Prefill のキャッシュヒットはさらに 80% 割引)は次のとおり。
| モデル | Prefill ($/1M) | Sample ($/1M) | Train ($/1M) |
|---|---|---|---|
| Inkling(64K) | 1.87 | 4.68 | 5.61 |
| Nemotron-3-Ultra(64K) | 2.49 | 6.225 | 5.478 |
| Kimi-K2.6(32K) | 2.205 | 5.49 | 4.84 |
割引適用後の Inkling は Prefill・Sample で Nemotron-3-Ultra より安く、Train は近い水準である。