ONESTRUCTION、AWS GenAIICと連携し建設業界特化型基盤モデル「Ishigaki-IDS」を構築
建設業界のデジタル変革を牽引する「Ishigaki-IDS」の概要と目的
日本の建設業界は、慢性的な人手不足に直面しており、デジタル技術の導入による生産性向上が喫緊の課題となっています。特に、設計、施工、維持管理の各段階で情報を一元化するBIM(Building Information Modeling)の普及は、国家レベルで推進されています。しかし、BIMの導入には専門知識が必要であり、その学習コストが普及を妨げる一因となっていました。具体的な例として、BIMモデル(IFCモデル)に添付される情報の定義と検証を行うXMLベースの標準であるIDS(Information Delivery Specifications)の作成は、その文法とIFCの規則に関する深い知識が求められます。
ONESTRUCTION株式会社は、この課題を解決するため、建設業界のBIMワークフローに特化した基盤モデル「Ishigaki-IDS」を開発しました。Ishigaki-IDSは、BIMの専門家ではない実務者でも、BIMモデルの属性情報のレビューや管理ができるように障壁を低減することを目的としています。具体的には、ユーザーがBIMデータに求められる要件やコンポーネント情報を入力するだけで、AIが対話形式で対応するIDSを提案・自動生成し、さらにその検証を可能にするシステムです。 このシステムは、高度な専門知識を要するIDS作成プロセスを自動化することで、BIMの実践的な普及を加速させることが期待されています。
AWS GenAIICが提供する高性能インフラと開発支援
ONESTRUCTIONのIshigaki-IDS基盤モデル開発は、AWSのGenerative AI Innovation Center (GenAIIC) からの技術アドバイスを受け、GENIAC(Generative AI Accelerator Challenge)フェーズ3の一環として実施されました。 GENIACは、日本の経済産業省(METI)および新エネルギー・産業技術総合開発機構(NEDO)が主導する国家プロジェクトであり、国内の生成AI開発能力を強化することを目的としています。
このプロジェクトでは、大規模な基盤モデル開発を支援するため、AWSが膨大なコンピューティングリソースを提供しました。具体的には、127台のAmazon EC2 P5インスタンス(NVIDIA H100 TensorCore GPUサーバー)と24台のAmazon EC2 Trn1インスタンス(AWS Trainium1サーバー)が短期間で展開されました。 また、AWSは、各チームがゼロからクラスターを構築する手間を省くため、事前検証済みのテンプレートと自動化を提供しました。これには、ユーザー管理のHPCクラスター向けのAWS ParallelClusterと、マネージドかつ回復性の高いクラスターサービス向けのSageMaker HyperPodが含まれます。
参照アーキテクチャは、コンピューティング、ネットワーク、ストレージ、コンテナ環境、監視までを含むフルスタックを網羅し、GitHubリポジトリとして提供されることで最小限の摩擦でのデプロイを可能にしました。 ストレージについては、性能とコスト効率のバランスを取る階層型アプローチが採用され、トレーニングデータの耐久性のある長期保存にはAmazon S3が使用されました。S3は、高性能アクセスを実現するFSx for Lustreファイルシステムとデータリポジトリ関連付け(DRA)を通じて連携され、S3とFSx for Lustre間でのデータの自動的かつ透過的な転送を可能にしました。 これらのインフラストラクチャは、AWS CloudFormationテンプレートを通じて容易にプロビジョニングされ、最適化されたネットワーク設定を持つ専用VPCや高性能なFSx for Lustreファイルシステムが自動的に構成されました。
ドメイン特化型基盤モデル構築における技術的課題と解決策
データが希少な分野でドメイン特化型の基盤モデルを構築することは、多くの課題を伴います。ONESTRUCTIONのIshigaki-IDS開発も例外ではありませんでした。主要な課題としては、十分なトレーニングデータの確保、専門知識の活用、および出力の検証方法の確立が挙げられます。 一般的なLLMは、建設業界に特有の深いドメイン知識、データ形式、および運用ワークフローを十分に理解できないため、これらの領域でギャップが生じます。
Ishigaki-IDSは、これらの課題に対し、以下のようなアプローチで解決を図りました。
-
専門データのキュレーションと活用: 建設業界特有のBIMデータやIDS関連文書といった専門性の高いデータを丹念にキュレーションし、モデルのトレーニングに活用しました。これにより、汎用モデルでは捉えきれない、業界固有のニュアンスや規則を学習させることが可能となりました。
-
専門知識の組み込み: IDSの文法やIFCモデルの規則に関する専門知識を、モデルの設計や教師データの作成プロセスに深く組み込むことで、生成されるIDSの正確性と適合性を高めました。
-
対話型インターフェースによる検証支援: Ishigaki-IDSは、ユーザーが要件を入力し、AIがIDSを提案する対話形式を採用しています。 このアプローチにより、専門家がAIの出力をレビューし、必要に応じて修正を加えることで、モデルの改善サイクルを確立し、最終的な出力の信頼性を確保しています。また、この対話性は、非専門家でもIDS作成プロセスに参加できる柔軟性を提供します。
ONESTRUCTIONは、HuggingFace上でIshigaki-IDS-8Bモデルを公開しており、これによりモデルの透明性とコミュニティによるさらなる発展を促しています。
開発者・エンジニア視点での考察
-
GENIACプログラムが提供するAWS ParallelClusterやSageMaker HyperPodのような事前検証済みクラウドアーキテクチャを活用することは、AIトレーニング環境を迅速に構築し、インフラ設定に費やす時間と労力を大幅に削減する上で極めて有効である。特に、P5インスタンスやTrn1インスタンスのような高性能GPUリソースの展開が容易になる点は、研究開発の加速に直結する。
-
大規模なAIトレーニングデータセットを管理する上で、Amazon S3による耐久性のある長期保存と、FSx for Lustreによる高パフォーマンスアクセスを組み合わせた階層型ストレージ戦略は、分散型AIトレーニングにおけるI/Oボトルネックを解消し、学習効率を最大化するためのベストプラクティスである。データリポジトリ関連付け(DRA)によるS3とFSx for Lustre間のシームレスなデータ転送は、運用の複雑性を低減する。
-
Ishigaki-IDSが採用している、対話形式でユーザー要件からIDSを自動生成するアプローチは、高度に専門化されたドメイン知識へのアクセスを民主化し、BIMのような複雑な標準の学習曲線を劇的に短縮する可能性を秘めている。これは、他のデータ希少かつ専門知識がボトルネックとなっている業界(例:医療、法律、特定の製造業)におけるAIアプリケーション開発の強力なヒントとなるだろう。
Source / 元記事
この記事について
この記事は、公開されているニュース、論文、公式発表、RSSフィードなどをもとに、AIが要約・補足調査・考察を行って作成しています。
元記事の完全な翻訳・逐語的な要約ではなく、AIによる背景説明や開発者向けの考察を含みます。
重要な技術仕様・価格・提供状況などは、必ず元記事または公式情報をご確認ください。


