開発の背景
LLMやVLMの進化に伴い、「危険なら逃げる」といった固定ルールでは対応しきれない複雑な判断やコミュニケーションをAIエージェントに担わせる研究が進んでいます。災害時の情報伝達や避難行動、都市や施設における人の流れ、サービス設計の事前検討など、生成AIによる社会シミュレーションの応用範囲は広がりつつあります。
しかし、既存の研究プラットフォームの多くは、大規模な計算環境やクラウド上のモデルサービス、専用のシミュレーターを前提としています。このため、「AIが何を認識し、どう推論し、それがどのような行動に変換されたのか」というプロセスが不明瞭になりがちで、学生や研究者、エンジニアが原理を理解しながら自由に改変するには高いハードルがありました。
SD-AgentFoundryは、このような状況に対し、機能の多さよりも「認識→推論→コミュニケーション→行動→観察」のループを追いやすいことを優先して設計された最小構成のシミュレーション基盤です。この名称が示すとおり、モデル、環境、シナリオ、評価方法を利用者が自ら置き換え、独自の研究や試作へ発展させるための土台となることを目指しています。
SD-AgentFoundryの概要
| 項目 | SD-AgentFoundry-2D | SD-AgentFoundry-3D |
|---|---|---|
| 駆動モデル | LLM(大規模言語モデル) | VLM(視覚言語モデル) |
| 環境 | 2Dの整数グリッド | USD形式の3Dデジタルツイン |
| エージェント数 | 複数(既定20体) | 1体 |
| 入力 | 数値状態+近隣エージェントからのメッセージ | 一人称RGB画像+タスク・現在位置・直近の行動履歴(テキスト) |
| 主な焦点 | コミュニケーション、情報伝播、集団行動 | 視覚認識、空間理解、身体性を伴う高レベル行動 |
| モデルの実行 | ローカルLLM(Ollama) | ローカルVLM(Ollama)を既定とし、他のバックエンドにも差し替え可 |
| 用途イメージ | 社会シミュレーション、避難・情報伝播、都市・施設の仮説検討 | ナビゲーション、施設利用、デジタルツイン上のAIエージェント検証 |
1. SD-AgentFoundry-2D:LLMエージェントの集団行動を観察する
SD-AgentFoundry-2Dでは、複数のLLMエージェントが2次元グリッド上に配置され、各エージェントが自身の情報のみをもとに、近くのエージェントとの会話と移動の判断を繰り返します。カフェや図書館の収容人数、混雑率、火災イベントなどを設定できますが、エージェントに与えられるのは位置や混雑率、火災の強度や距離といった数値情報のみです。これにより、警告の伝播、協調、回避、集合といった行動が、モデル自身の判断としてどのように現れるかを観察できます。モデル、ペルソナ、通信距離、記憶の長さ、配置、イベント条件などを変更し、同一条件下でLLMを差し替えた際の行動特性の違いを比較する基礎環境として活用可能です。
2. SD-AgentFoundry-3D:VLMがデジタルツインを「見て、判断し、動く」
SD-AgentFoundry-3Dでは、USD(Universal Scene Description)形式のデジタルツイン内にエージェントを1体配置し、エージェント視点の一人称画像をVLMに入力します。VLMは画像、タスク、現在位置、直近の行動履歴をもとに次の行動を自然言語で出力し、シミュレーターがその文章を解釈して移動、回転、視線変更などの行動に変換します。出力形式をJSONなどに縛らず、モデルの自由な文章をそのまま行動に読み替える点が特徴です。
同梱のデモでは、国際宇宙ステーション(ISS)の日本実験棟「きぼう」を再現したUSD環境を使用し、「JAXAロゴを探して近づく」タスクを実行します。USDシーンを置き換えれば、施設や街路、作業環境などのデジタルツインにおける視覚的な探索やナビゲーションの研究へ応用可能です。軽量な構成で動作し、重量級のゲームエンジンを必要としません。
なお、現行版は物理演算や接触・把持を扱うロボット制御基盤ではありません。VLMの自然言語出力を高レベルの行動へ変換する研究用シミュレーションであり、ロボット制御向けに学習されたVLA(Vision-Language-Action)モデルとは異なります。
特徴
-
ローカル実行を前提とした構成: macOS、Windows、Linux向けのセットアップ手順が用意され、Ollamaを通じてローカルのオープンなLLM/VLMで動作します。クラウドAPIに依存せず、モデルや計算環境を利用者側で選択できます。
-
認識から行動までのループが読める: 複雑な統合基盤としてブラックボックス化するのではなく、認識、推論、コミュニケーション、行動、観察の各処理を追跡しやすいコード構成となっています。
-
モデル・環境・シナリオを交換できる: 2D版ではシナリオやエージェント設定を、3D版ではUSDシーン、タスク、VLMバックエンド、行動の解釈ルールをそれぞれ置き換え可能です。
-
検証・監査に向けたログ: 3D版では、VLMの生の応答、解釈された行動、行動前後の姿勢、推論時間、入力画像などが毎回記録され、エージェントがなぜそのように動いたのかを後から確認できます。2D版も、エージェントの記憶・推論とメッセージをログとして保存します。
想定する活用領域と留意点
本基盤は、教育、研究、PoC(概念実証)の初期検討を主な用途としています。災害・緊急時の情報伝達や集団行動に関する仮説生成、都市・施設における人流や施設選択の探索的検討、デジタルツイン上での視覚探索・ナビゲーション、同一条件でLLM/VLMを差し替えた際の行動比較、AIエージェント教育やハッカソンでの利用などが想定されます。
※本シミュレーションの出力は、人間の行動や実世界の結果を検証済みの精度で予測するものではありません。仮説生成、メカニズム比較、シナリオ検討を目的とする基盤であり、実社会に関する結論を導くには、別途、実証データによる検証が必要です。
今後の展望
兵頭博士は今後、さまざまなLLM/VLMやデジタルツイン環境との接続、エージェント評価手法の拡充、複数エージェントと3D環境を組み合わせた検証などを進める予定です。
スペースデータは、「空間を情報化し、AIに物理を学ばせ、機械が自律的に動けるようにする「空間知能」の実現に取り組んでいます。デジタル空間の中で生成AIが状況を認識し、意思決定し、行動するための研究は、その基礎をなすものです。SD-AgentFoundryで得られる知見を、デジタルツインやフィジカルAIの研究開発と往復させながら、宇宙、都市、防災、施設運用など多様な実世界課題に対するAIエージェント技術の可能性を探索していく方針です。
開発者コメント:スペースデータ 最高科学責任者(CSO)兵頭龍樹博士
「AIエージェントの活用の可能性は、社会シミュレーションから、一人称視点で環境を認識し行動するシミュレーションまで、多岐にわたります。今回、LLMやVLMを用いたAIエージェントが何を認識し、どう判断し、どのような行動につなげるのかを、できるだけシンプルで追いやすい形で試せる環境としてSD-AgentFoundryを構築しました。研究者や学生、開発者の皆さまが、2Dの社会的な相互作用から3Dデジタルツイン上の身体性を伴う行動まで、自分たちの課題や環境に合わせて自由にアイデアや仮説を試し、発展させていく出発点になればと考え、公開を決めました。また、この基盤を出発点として、スペースデータにおける事業化に向けた研究開発にもつなげていきたいと考えています。」
技術論文・リポジトリ情報
-
論文タイトル:Minimal Local Simulation Foundations for LLM- and VLM-Driven Agents in 2D and 3D Environments
-
著者:兵頭龍樹(株式会社スペースデータ/立教大学大学院 人工知能科学研究科/東京科学大学 地球生命研究所/パリ・シテ大学)
-
公開:arXiv(cs.MA / cs.AI)、2026年8月24日
-
DOI:10.48550/arXiv.2608.22833
-
SD-AgentFoundry-2D(GitHub):https://github.com/ryukih/SD-AgentFoundry-2D
-
SD-AgentFoundry-3D(GitHub):https://github.com/ryukih/SD-AgentFoundry-3D
-
ライセンス:Apache License 2.0
※本論文はプレプリント(査読前の論文)としてarXivに公開されています。
株式会社スペースデータについて
株式会社スペースデータは、「宇宙の民主化」を使命に、宇宙をはじめとするあらゆる空間の知能化(MAKE SPACE INTELLIGENT)に取り組むテクノロジースタートアップです。
空間を情報化し、AIに物理を学ばせ、機械が自律的に動けるようにする「空間知能」の技術を活用し、宇宙開発から都市開発、防災、安全保障まで、次の未来を支えるデジタルプラットフォームの構築を国内外で進めています。
スペースデータの公式サイトでは、最新の取り組みや発表が紹介されています。詳細はhttps://spacedata.jp/newsをご覧ください。
-
社名:株式会社スペースデータ
-
代表:佐藤航陽
-
所在地:東京都港区虎ノ門1-17-1 虎ノ門ヒルズビジネスタワー 15階
-
資本金:15億1300万円
-
事業内容:宇宙開発に関わる投資と研究
AI Workstyle Lab編集部コメント
スペースデータCSOの兵頭博士によるSD-AgentFoundryの公開は、生成AIエージェントの研究開発において重要な一歩です。特に、大規模な計算リソースやクラウドサービスに依存せず、ローカル環境でAIエージェントの「認識→推論→コミュニケーション→行動→観察」のループを追跡しやすい最小構成を提供している点は画期的と言えます。これにより、学生や研究者がAIエージェントの原理を深く理解し、自由に改変しながら独自のアイデアを検証できる土台が確立されます。既存のブラックボックス化しがちなプラットフォームと比較して、透明性と柔軟性が飛躍的に向上し、今後のAIエージェント技術の進化を加速させるでしょう。
「AIニュースは追っているけど、何から学べばいいか分からない…」 そんな初心者向けに、編集部が本当におすすめできる無料AIセミナーを厳選しました。
- 完全無料で参加できるAIセミナーだけを厳選
- ChatGPT・Geminiを基礎から体系的に学べる
- 比較しやすく、あなたに合う講座が一目で分かる
ChatGPTなどの生成AIを使いこなして、仕事・収入・時間の安定につながるスキルを身につけませんか?
AI Workstyle LabのAIニュースをチェックしているあなたは、すでに一歩リードしている側です。あとは、 実務で使える生成AIスキルを身につければ、「知っている」から「成果を出せる」状態へ一気に飛べます。
講師:栗須俊勝(AI総研)
30社以上にAI研修・業務効率化支援を提供。“大阪の生成AIハカセ”として企業DXを牽引しています。
- 日々の業務を30〜70%時短する、実務直結の生成AI活用法を体系的に学べる
- 副業・本業どちらにも活かせる、AI時代の「稼ぐためのスキルセット」を習得
- 文章・画像・資料作成など、仕事も趣味もラクになる汎用的なAIスキルが身につく
ニュースを読むだけで終わらせず、
「明日から成果が変わるAIスキル」を一緒に身につけましょう。
本記事は、各社の公式発表および公開情報を基に、AI Workstyle Lab編集部が 事実確認・再構成を行い作成しています。一次情報の内容は編集部にて確認し、 CoWriter(AI自動生成システム)で速報性を高めつつ、最終的な編集プロセスを経て公開しています。

