Thinking Machines Labが9,750億パラメータのオープンウェイトAIモデル「Inkling」を公開:マルチモーダル汎用性とカスタマイズ性への新機軸


ADVERTISEMENT

Thinking Machines Labは、総パラメータ数9,750億、アクティブパラメータ数410億のオープンウェイトAIモデル「Inkling」をリリースしました。このモデルは、Apache 2.0ライセンスの下で公開され、テキスト、画像、音声にわたるネイティブなマルチモーダル処理能力と、高度なカスタマイズ性を特徴としています。Inklingは、同社のTinkerプラットフォームでのファインチューニングを可能にし、開発者コミュニティに新たな基盤モデルを提供することを目指しています。

Inklingの革新的アーキテクチャとマルチモーダル能力

Inklingは、総パラメータ数9,750億、そのうちアクティブパラメータが410億という大規模ながら効率的なMixture-of-Experts (MoE) トランスフォーマーアーキテクチャを採用しています。 具体的には、66層のデコーダーオンリー型トランスフォーマーであり、疎なMoEフィードフォワードバックボーンを備えています。各MoE層には256個のルーティングされたエキスパートと2個の共有エキスパートが含まれ、各トークンに対して6個のルーティングされたエキスパートと両方の共有エキスパートが活性化されます。 エキスパートの選択はシグモイドベースのルーターによって行われ、補助損失なしのロードバランシングバイアスが用いられています。

アテンション機構においては、従来のロータリーポジショナルエンベディング(RoPE)ではなく、相対位置エンベディングが採用されており、長尺シーケンスへの優れた外挿性を実現しています。 また、局所的なスライディングウィンドウアテンションとグローバルアテンション層を5対1の比率で交互に配置するハイブリッドアテンション構造により、計算効率と広範なコンテキスト理解を両立させています。 キーとバリューの射影後、および残差ブランチの出力には短い畳み込みが適用され、モデルの表現能力を向上させています。

マルチモーダル能力に関しては、Inklingはテキスト、画像、音声の入力をネイティブに処理し、UTF-8形式のテキストを出力します。 画像および音声入力に対してはエンコーダーフリーのアーキテクチャを採用しており、画像は4層のhMLPを介して40x40ピクセルのパッチに、音声はdMelスペクトログラムとして入力されます。 これら異なるモダリティのデータは軽量な埋め込み層を通過した後、共有された隠れ空間に投影され、デコーダーによってテキストトークンと統合されて処理されます。 最大100万トークンという広大なコンテキストウィンドウをサポートしており、複雑なマルチモーダルタスクでの推論能力が期待されます。

「思考努力」による効率性とベンチマーク性能

Inklingの際立った特徴の一つは、「Controllable thinking effort(制御可能な思考努力)」メカニズムです。これにより、開発者はパフォーマンスとコストのバランスを動的に調整できます。 例えば、Terminal Bench 2.1においてNemotron 3 Ultraと同等のパフォーマンスを達成するために、Inklingは3分の1のトークンしか消費しないことが報告されており、非常に高いトークン効率性を示しています。 この機能は、AIアプリケーションにおけるリソースの最適化と運用コストの削減に大きく貢献します。

Thinking Machines Labは、Inklingを特定のベンチマークに特化させるのではなく、幅広い領域で優れた性能を発揮する汎用的な基盤モデルとして設計しました。 エージェント機能、推論、コーディング、指示追従、正確性、視覚、音声といった多様なタスクにおいてバランスの取れた性能を示すよう訓練されています。

ベンチマーク結果では、InklingはArtificial Analysis Intelligence Indexで41点を獲得し、米国製のオープンウェイトモデルとしてはトップに立っています。これは、従来のトップであったNemotron 3 Ultraの38点やGemma 4 31Bの29点を上回るスコアです。 特にエージェント機能の性能に優れており、GDPval-AA v2ではElo 1238点を記録し、Kimi K2.6やDeepSeek v4 Flash maxを凌駕しています。 また、SWE-bench Verifiedでは77.6%を達成し、Nvidia Nemotron 3の71.9%を上回りました。 FORTRESS Adversarialベンチマークでもオープンウェイトモデルの中で最高の78.0%を記録しています。 一方で、GLM 5.2やKimi K2.6と比較すると、HLEやTerminal Bench 2.1、SWEBench Verifiedなどの一部のベンチマークでは劣る点も指摘されています。

カスタマイズ性と開発者エコシステムへの貢献

Inklingのリリースにおける核心的な戦略は、「カスタマイズの基盤」としての位置づけです。Thinking Machines Labは、モデルの重みを完全に公開し、Apache 2.0ライセンスで提供することで、開発者が自由にモデルを検査し、オンプレミスやプライベートクラウドで実行し、特定の用途に合わせてファインチューニングできる環境を整えています。

モデルのファインチューニングは、Thinking Machines Labが提供する「Tinker」プラットフォームを通じて可能であり、開発者はInkling Playgroundでモデルと対話しながらカスタマイズを試すことができます。 さらに、Hugging Faceでもモデルの重みが提供されており、Hugging Face Transformers、SGLang、vLLM、llama.cppといった主要なオープンソースライブラリにおけるDay-0サポートも確立されています。 これにより、幅広い開発者がInklingを自身のワークフローに容易に統合し、特定のドメインやタスクに最適化されたAIアプリケーションを構築することが促進されます。

また、Inklingは検閲の対象となりうるトピックに対しても直接回答するように訓練されており、企業が論争や機密性に関わらず客観的な出力を求める際に信頼性の高い選択肢を提供します。 これは、AIの倫理的利用と信頼性向上への重要な一歩と言えます。Inkling-Smallという、より軽量な120億アクティブパラメータモデルのプレビューも提供されており、コストとレイテンシが重視されるワークロードに対応する選択肢も用意されています。

開発者・エンジニア視点での考察

  1. MoEとハイブリッドアテンションの活用: InklingのMoE(Mixture-of-Experts)とハイブリッドアテンション(スライディングウィンドウとグローバル)の組み合わせは、計算効率と広範なコンテキスト処理を両立させるための先進的なアプローチであり、大規模モデル開発におけるリソース最適化の新たな道を示唆しています。 このアーキテクチャ設計は、将来の大規模AIモデルにおいて、いかにして性能を維持しつつ運用コストを削減するかという課題に対する重要なヒントを提供します。

  2. エンコーダーフリーのマルチモーダル入力処理: 画像を4層hMLPによる40x40ピクセルパッチ、音声をdMelスペクトログラムとして直接デコーダーで処理するエンコーダーフリーのアプローチは、異なるモダリティを統合する際の計算オーバーヘッド削減とアーキテクチャの簡素化に貢献し、フュージョンモデル設計の新たな可能性を開きます。 これは、特にエッジデバイスやリソース制約のある環境でのマルチモーダルAIの展開において、新たな最適化戦略を模索する開発者にとって注目すべき点です。

  3. 調整可能な思考努力とコスト最適化: 「Controllable thinking effort」機能により、開発者はパフォーマンス要件に応じてトークン効率と推論コストを動的に調整できるため、多様なアプリケーションにおけるAIの展開を経済的に最適化し、実用性を高めます。 この機能は、リアルタイム応答が求められるエージェントや、バッチ処理でコスト効率を最大化したいシナリオなど、さまざまなビジネス要件に対応するための柔軟性を提供し、AIソリューション設計における新たな考慮事項となります。


Source / 元記事

この記事について

著者
AIBloom AI編集部
初回公開
最終更新

この記事は、公開されているニュース、論文、公式発表、RSSフィードなどをもとに、AIが要約・補足調査・考察を行って作成しています。

元記事の完全な翻訳・逐語的な要約ではなく、AIによる背景説明や開発者向けの考察を含みます。

重要な技術仕様・価格・提供状況などは、必ず元記事または公式情報をご確認ください。

About AIBloom

ADVERTISEMENT