Together AI、Thinking Machines Labの革新的マルチモーダルモデル「Inkling」をDay 0リリース:オープンウェイトAIの新たな地平


ADVERTISEMENT

Inklingモデルの技術的詳細と革新性

Thinking Machines Labが発表した新しいオープンウェイトAIモデル「Inkling」は、その革新的なアーキテクチャと広範な機能により、AI業界に新たな選択肢を提示しています。Inklingは、合計9750億のパラメータを持つMixture-of-Experts(MoE)アーキテクチャを採用しており、個々のタスク実行時には約410億のアクティブパラメータを使用することで、高い運用速度とコスト削減を両立させています。この設計は、リソース効率を最大化しつつ、大規模モデルのメリットを享受することを可能にします。

Inklingの最も注目すべき特徴は、そのマルチモーダルな能力にあります。テキスト、音声、画像、ビデオを含む45兆トークンのマルチモーダルデータで訓練されており、これらの多様な入力形式をネイティブに処理し、モダリティを超えた推論を可能にします。また、100万トークンという広範なコンテキストウィンドウをサポートしており、複雑なタスクや長文の理解において優れた性能を発揮することが期待されます。

技術的な深掘りとして、Inklingはデコーダーオンリーのアーキテクチャを採用しており、最新のLLMに広く見られる因果的自己回帰生成をサポートしています。さらに、位置情報をエンコードするために、RoPE(Rotary Positional Embedding)の代わりに相対アテンションを使用している点も特筆すべきです。これにより、各アテンション層がアテンションロジット内で直接位置情報を学習します。加えて、推論を高速化するための投機的MTP層を組み込んでおり、BF16とNVFP4の両方のバリアントで提供されるなど、実装面での最適化も徹底されています。Inklingは、出力量における不確実性を明示する機能や、ユーザーが「思考努力」を調整して速度と精度のバランスを取ることを可能にするなど、実用的なビジネスアプリケーションにおける信頼性と柔軟性を高める設計がなされています。

Together AIの役割と高性能インフラストラクチャ

Together AIは、Thinking Machines LabのInklingモデルが「Day 0」で公開された際に、その即時利用可能性を支える重要な役割を果たしています。Together AIは、オープンソースの大規模言語モデルのトレーニング、ファインチューニング、およびサービス提供に特化した高性能クラウドインフラストラクチャを提供しています。このプラットフォームは、最新のAIモデルが研究開発段階から実運用へと迅速に移行するための基盤となります。

Together AIのインフラストラクチャは、NVIDIA H100、H200、GB200、A100を含むハイエンドGPUクラスターを特徴とし、低遅延かつ大規模なAIワークロードに対応できるよう最適化されています。推論の高速化には、投機的デコード、量子化、FP8カーネルといった高度な技術が用いられており、これにより、Together AIは競合他社と比較して最大4倍高速な推論速度と、GPT-4oと比較して最大11倍低いコストを実現すると主張しています。

Inklingのような大規模なマルチモーダルモデルの迅速なデプロイメントには、このような最適化されたインフラと、OpenAI互換APIのような開発者フレンドリーなツールが不可欠です。Together AIは、数百のオープンソースモデルをサポートし、統一されたAPIを通じて、開発者が多様なAIアプリケーションを構築・展開できるスケーラブルな環境を提供します。InklingがDay 0でtransformers、SGLang、llama.cppといった主要な開発ツールでサポートされたのは、Together AIが提供するこの強固な基盤があればこそ実現したものです。

オープンウェイト戦略とエンタープライズへの影響

Thinking Machines LabがInklingを「オープンウェイト」モデルとしてリリースしたことは、AI業界における戦略的な転換点を示唆しています。オープンウェイトモデルとは、開発者がその基盤となるシステムをダウンロードし、実行、カスタマイズできることを意味し、これはOpenAIやGoogleのような大手企業が提供するクローズドモデルとは対照的です。

Thinking Machines Labは、Inklingを汎用的なチャットボットとしてではなく、企業が特定のニーズに合わせてカスタマイズできるソリューションとして位置付けています。同社は、企業が標準化されたモデルに依存すると、しばしば専門知識が失われると指摘し、これに対処するために、企業が自社の専門知識に基づいてInklingをファインチューニングできるプラットフォーム「Tinker」を提供しています。このアプローチは、AIシステムが組織の特定の要件に合わせて調整されることで、“one-size-fits-all”モデルよりも高い効率性を提供するという同社の哲学に基づいています。

Inklingは、現時点では市場で最も高性能なモデルではないとしながらも、多様なモダリティ入力、調整可能な思考努力、およびドメイン適応性への注力により、その実用性と将来性を強調しています。ベンチマークでは、クローズドモデルや一部の中国製オープンソースモデルに対して競争力のある結果を示しており、特にエージェント関連のタスクで強みを発揮しています。さらに、開発プロセス中にInkling自身がモデルのファインチューニングと改善に貢献したという「自己改善」の事例は、将来のAI開発におけるモデルの自律的な進化の可能性を示唆しており、注目に値します。

開発者・エンジニア視点での考察

  1. MoEアーキテクチャとコスト効率の最適化: InklingのMoE設計(9750億総パラメータ、410億アクティブパラメータ)と、実行時に「思考努力」を調整できる機能は、開発者が特定のアプリケーションの要件に応じてパフォーマンスとコストのバランスを細かく制御できることを意味します。これにより、リソースが限られたエッジデバイスや、応答速度が重要なリアルタイムシステムにおいて、計算リソースを最適化し、効率的なAIソリューションを展開するための新たな道が開かれます。

  2. マルチモーダル入力の統合とエージェント機能による高度なアプリケーション開発: Inklingがテキスト、音声、画像、ビデオのマルチモーダル入力をネイティブに処理し、エージェント機能を持つことは、開発者がより複雑で人間中心のインタラクティブなAIアプリケーションを構築するための強力な基盤を提供します。これまでの開発では、各モダリティを個別のモデルで処理し、それらを統合するための複雑なパイプラインが必要でしたが、Inklingの登場により、リアルタイム対話システム、高度な自動化エージェント、複合的な状況認識システムなどの開発が、よりシンプルかつ効率的に行えるようになるでしょう。

  3. Together AIエコシステムを通じた最先端モデルへの即時アクセスと迅速なプロトタイピング: Together AIが提供する高性能なクラウドインフラとDay 0サポートは、Thinking Machines LabのようなAIラボが最新モデルを迅速に公開し、開発者が発表と同時にそのモデルを利用できるエコシステムを形成しています。これにより、研究成果が実用的なアプリケーションとして市場に投入されるまでのタイムラインが大幅に短縮され、開発者は常に最先端のAI技術にアクセスし、迅速なプロトタイピングとイノベーションを推進することが可能になります。これは、AI開発のサイクルを加速させ、競争の激しい市場において優位性を確立する上で極めて重要です。

Source / 元記事

この記事について

著者
AIBloom AI編集部
初回公開
最終更新

この記事は、公開されているニュース、論文、公式発表、RSSフィードなどをもとに、AIが要約・補足調査・考察を行って作成しています。

元記事の完全な翻訳・逐語的な要約ではなく、AIによる背景説明や開発者向けの考察を含みます。

重要な技術仕様・価格・提供状況などは、必ず元記事または公式情報をご確認ください。

About AIBloom

ADVERTISEMENT