- 【AIの基礎】
01|AIモデル
02|アルゴリズム
03|ニューラルネットワーク
04|大規模言語モデル(LLM)
05|基盤モデル(ファウンデーションモデル)
06|GPU - 【AIの学び方】
07|機械学習(マシンラーニング)
08|ディープラーニング(深層学習)
09|教師あり学習
10|教師なし学習
11|アノテーション
12|強化学習
13|蒸留(ディスティレーション) - 【モデルの構造】
14|トランスフォーマー
15|パラメーター
16|トークン - 【動作する仕組み】
17|プロンプト
18|マルチモーダル
19|RAG(検索拡張生成)
20|推論モデル
21|MCP(Model Context Protocol)
22|AIエージェント - 【リスクと課題】
23|ハルシネーション(幻覚)
24|アライメント
25|ディープフェイク
26|AIスロップ - 【物理世界への接続と広がり】
27|フィジカルAI
28|エッジAI
29|世界モデル(World Model)
30|ブレイン・マシン・インターフェイス(BMI)/BCI - 【進歩の先にあるもの】
31|汎用人工知能(AGI)
32|人工超知能(ASI)
33|シンギュラリティ(技術的特異点)
【AIの基礎】
入力されたデータをもとに人工知能(AI)がパターンや規則性を学習し、予測や判断、生成を実行するための数学的な仕組みのこと。モデル自体の構造と、学習によって調整される数値(パラメーター)の組み合わせでできており、画像認識や自然言語処理、音声合成など、目的に応じてさまざまな種類が存在する。近年注目される大規模言語モデル(LLM)も、AIモデルの一種である。学習を終えたAIモデルは、新しい入力に対しても学習した傾向をもとに応答できるようになる。
問題を解決するための手順や計算方法を、明確なステップとして定めたもの。料理のレシピのように、入力から出力を得るまでの一連の処理の流れと考えるとわかりやすい。AIの分野では、データからパターンを学習する「機械学習アルゴリズム」や、学習済みモデルが計算を実行する際の処理手順を指すことが多い。同じデータを使っても、採用するアルゴリズムによって精度や速度、必要な計算資源は大きく変わってくる。
人間の脳内にある神経細胞(ニューロン)のつながりに着想を得たAIの基本構造のひとつ。「層」と呼ばれる単位を何層にも重ね、各層のノード同士を結ぶ「重み」を調整しながら学習を進める。入力層でデータを受け取り、中間層で特徴を抽出し、出力層で結果を導き出す。この構造を何層にも深く重ねたものが「ディープラーニング(深層学習)」であり、現在のAIブームを支える基盤技術となっている。
Large Language Modelの略。膨大な量のテキストデータを学習することで、文章の生成や要約、翻訳、質問への応答など、幅広い言語タスクをこなせるようになったAIモデルのこと。次に来るトークン(文章を細かく区切った単位)を確率的に予測する仕組みを基本としながら、パラメーター数を増やし学習データを拡大することで、人間らしい自然な文章を生成できるようになった。ChatGPTやClaudeなど、対話型AIサービスの多くはLLMを基盤としている。
特定の用途に限定せず、大量かつ多様なデータを事前学習することで、幅広いタスクに応用できる汎用性を備えたAIモデルのこと。テキストや画像、音声といった分野ごとに幅広い用途の土台となり、複数の種類をまとめて扱えるモデルもあることから、用途ごとにゼロからモデルをつくり直す必要性を減らせるようになった。ひとつの基盤モデルをもとに追加学習(ファインチューニング)を施すことで、翻訳や要約、画像生成など個別の目的に特化したモデルを効率よく構築できる。大規模言語モデルも基盤モデルの代表例のひとつである。
Graphics Processing Unitの略。画像や映像の描画処理を高速で実行するための半導体チップを指す。大量の並列計算を得意とする特性がAIの学習・推論と相性がよく、現在ではAI開発を支える主要な計算基盤のひとつである。ニューラルネットワークの学習には膨大な行列計算が必要とされることから、CPUよりも並列処理性能に優れるGPUが広く使われる。AI向けではNVIDIAの製品が市場で高いシェアを占めており、もともとはゲームの描画などに用いられていた。
【AIの学び方】
明示的なルールを人間が一つひとつ与えるのではなく、AIが大量のデータからパターンや規則性を自動的に学びとる技術の総称。従来のプログラムは条件と処理を人間が細かく記述していたが、機械学習はデータそのものから規則を導き出す点が大きく異なる。学習方法によって、正解データをもとに学ぶ「教師あり学習」、データの構造を自ら見出す「教師なし学習」、試行錯誤を通して学ぶ「強化学習」などに分類される。なお、ディープラーニングは機械学習の手法のひとつ。
ニューラルネットワークを何層も深く重ねることで、より複雑なパターンを学習できるようにした機械学習の一手法。層の数はモデルによって数十から数百に及ぶこともあり、層を重ねることで入力データの特徴を段階的に捉えられるようになる。2010年代以降、画像認識や音声認識の精度が飛躍的に向上した背景には、このディープラーニングの発展とGPUの計算能力の向上が大きくかかわっている。
入力データと、それに対応する正解(ラベル)がセットになったデータを使って、AIにパターンを学習させる手法。人間が用意した“お手本”と自らの予測を照らし合わせながら学べる一方で、精度はラベルやデータの質にも左右される。例えば「猫の画像」と「猫」というラベルの組み合わせを大量に学習させることで、未知の画像が猫かどうかを判定できるようになる。分類や回帰といった課題に広く用いられ、機械学習のなかでも古くから使われてきた基本的な手法のひとつである。
正解ラベルを与えず、データそのものがもつ構造や規則性をAIに見出させる学習手法。ラベル付けの手間がかからないぶん、人間がまだ気づいていない意外な共通点やグループ分けを発見できる可能性を秘めている。似た性質のデータをグループに分ける「クラスタリング」や、データの特徴を圧縮して表現する「次元削減」などに用いられる。学習結果の解釈が難しい場合もあるが、大量の未整理データを扱う場面で活用されている。
AIに学習させるデータに対して、正解ラベルや注釈を付ける作業のこと。ラベルの誤りや偏りがモデルの精度や公平性に大きく影響することから、地味な作業でありながらAI開発全体を支える重要な工程と位置づけられている。例えば、画像に写っている物体を囲んで「犬」「クルマ」などとラベル付けしたり、文章に感情の分類を付けたりする作業がこれにあたる。ただ、人手による作業が多く、コストと時間がかかる。近年ではAIを使ってアノテーション作業自体を効率化する取り組みも進んでいる。
AIが試行錯誤を繰り返しながら、行動に対する「報酬」を最大化するように学習していく手法。人間が正解を教えるのではなく、よい行動には高い報酬を、悪い行動には低い報酬を与えることで、AI自身が最適な行動方針を見つけ出していく。正解データをあらかじめ用意する必要がなく、環境との相互作用のなかで方策そのものを磨いていける点が特徴だ。囲碁AIの「AlphaGo」や、ロボットの制御、対話型AIの応答調整(人間のフィードバックによる強化学習=RLHF)などに応用されている。
大規模で高精度な「教師モデル」の知識を、より小型で軽量な「生徒モデル」に転移させる手法。加熱した液体の蒸気を冷やして目的の成分を取り出す蒸留の工程になぞらえた呼び名で、大きなモデルがもつ知識のエッセンスだけを抽出して受け継がせるイメージに近い。教師モデルの出力の傾向を真似るように生徒モデルを学習させることで、性能の低下を抑えながら計算コストの少ない軽量なモデルをつくれる利点がある。スマートフォンなどの限られた計算資源で動かす必要がある場面で特に重宝される技術といえる。
【モデルの構造】
現在の大規模言語モデルの基礎となるニューラルネットワークの構造で、2017年にグーグルの研究者が発表した。文章中の単語のようなトークン同士の関連性を「注意機構(アテンション)」という仕組みで捉えることで、離れた位置にある単語同士の関係も効率よく学習できる。発表時の論文タイトル「Attention Is All You Need」が象徴するように、それまで主流だった単語を順番に処理していく仕組みに頼らず、注意機構を中心にした構造で高い性能を示した点が画期的だった。この構造の登場によって大規模な並列学習が可能になり、現在のLLMブームの土台が築かれた。
AIモデルの内部にある学習によって調整される数値のこと。ニューラルネットワークにおける「重み」や「バイアス」がこれにあたり、学習データを繰り返し処理するなかで少しずつ最適化されていく。パラメーターの数はモデルの規模を示す指標としてよく用いられ、「〇〇億パラメーター」のように表現される。数十億から数兆単位まで規模はさまざまで、一般に数が多いほどモデルの表現力は高まりうるが、そのぶん計算コストも増大する。また、実際の性能は構造や学習データ、学習方法にも左右される。
AIが文章を処理する際の文字列の区切り単位のこと。単語そのものだけでなく、単語の一部や句読点なども1トークンとして扱われることがあり、日本語は英語に比べて1文字あたりのトークン数が多くなりやすいという特徴もある。大規模言語モデルは文章をトークンの並びに分解したうえで、次に続くトークンを確率的に予測することで文章を生成する。APIの利用料金や、一度に処理できる文章の長さ(コンテキストウィンドウ)も、トークン数を基準に定められることが多い。
【動作する仕組み】
AIに対して与える指示や質問、入力文のこと。プロンプトの書き方次第で、AIから引き出せる回答の質や方向性は大きく変わることから、望ましい結果を得るための指示の工夫を「プロンプトエンジニアリング」と呼ぶ。具体的な条件や例を示す、役割を与える、出力形式を指定するといった工夫のほか、回答の手本を示したり複雑な課題を小分けにしたりするなど、利用するモデルに応じたさまざまなテクニックが日々共有されている。
文章だけでなく、画像や音声、動画など複数の種類(モダリティ)の情報を同時に扱えるAIの性質のこと。従来のAIは文章なら文章、画像なら画像と扱えるデータの種類が限定されていたが、マルチモーダルAIは異なる種類の情報を組み合わせて理解・生成できる。写真を見せて内容を尋ねたり、会議の音声から議事録を作成したりと、人間が複数の感覚を組み合わせて物事を理解するようなかたちでの活用が期待されている。
Retrieval-Augmented Generationの略で、日本語ではRAGを「ラグ」と読む。AIが回答を生成する際に、あらかじめ用意された外部の文書やデータベースを検索し、その内容をもとに回答を作成する仕組み。大規模言語モデルは学習時点までの知識しかもたないが、RAGを組み合わせることで最新の情報や社内文書など、学習データに含まれない内容にも対応できるようになる。これにより適切な資料を検索できれば、誤った情報を生成するリスクの低減にもつながる。
内部で段階的な思考の過程(推論)を経てから結論を導き出すよう訓練された大規模言語モデルのこと。推論時により多くの計算を費やす「テスト時計算」という考えに基づく手法で、回答までに時間がかかる代わりに複雑な課題での精度向上を目指している。複雑な数学の問題やコードの記述など、多段階の論理的思考を要する課題において、通常のモデルよりも高い精度を発揮しやすい。近年、各社の開発競争が加速している分野でもある。
AIモデルが外部のツールやデータソースと連携するための共通の手順を定めた規格で、2024年11月にAnthropicが提唱した。それまではAIと外部サービスをつなぐためには連携先ごとに個別の接続方法が必要だったが、MCPという共通規格によりその手間を大幅に減らせるようになった。25年12月にはLinux Foundation傘下に新設された「Agentic AI Foundation(AAIF)」にAnthropicがMCPを寄贈し、特定の企業に依存しない業界標準としての性格を強めている。
与えられた目標に対してAI自らが計画を立て、複数の手順やツールの利用を判断しながら自律的にタスクを遂行する仕組みのこと。人間が逐一指示を出さなくても、状況に応じて次にとるべき行動を自分で選びとっていく点が、これまでの対話型AIとの大きな違いだ。必要な情報を自ら検索したり、外部サービスを操作したりしながら、目的達成までの一連の作業を進めていく。MCPのような連携規格の広がりとも合わせて、実用化が急速に進みつつある分野である。
【リスクと課題】
AIが事実に基づかない情報をもっともらしく生成してしまう現象のこと。「幻覚」という訳語の通り、モデルが誤りであることを示さないままそれらしい体裁の文章として出力してしまう点が厄介とされる。大規模言語モデルは学習データに基づいて統計的に文章を生成する仕組みであるがゆえに、存在しない事実や誤った情報を自信ありげな口調で答えてしまうことがある。RAGの活用や、生成内容の裏付け確認(ファクトチェック)は、この課題への代表的な対策とされる。
AIの出力や振る舞いを人間の意図や価値観、社会的な規範に沿ったものにする取り組みのこと。「整合」という意味の通り、AIの目的を人間の望む方向にすり合わせていく作業と捉えるとわかりやすい。高性能なAIほど、意図しない有害な出力や指示から逸脱した挙動が及ぼす影響も大きくなりうることから、学習段階や運用段階でさまざまな調整が施される。人間のフィードバックをもとにモデルを調整する「RLHF」という手法は、アライメントを実現する代表的な手段のひとつである。
AI技術を用いて、実在する人物や物体、場所、出来事などに似せて、本物らしく加工・生成した偽の画像や映像、音声のこと。ディープラーニング(深層学習)の「Deep」と、偽物を意味する「Fake」を組み合わせた造語(Deepfake)。本人が話していない内容をあたかも発言したかのように見せられることから、なりすまし詐欺や偽情報の拡散といった悪用が世界的な問題になっている。近年では、生成物であることを検知する技術や、電子透かしを用いた対策の研究も進められている。
生成AIによって大量生産された内容の薄い低品質なコンテンツを指す俗語。英語の「Slop(残飯やくずの意)」に由来する。文章や画像、動画などをAIで瞬時に大量生成できるようになったことで、閲覧数や広告収入だけを目的とした中身のない投稿が増えているほか、低品質な合成コンテンツがSNSや検索結果にあふれる現象が世界的に問題視されている。閲覧する側が真偽や質を見極める負担が増していることも、情報社会の課題として指摘されている。なお、25年には辞書の発行で知られる米国のメリアム・ウェブスターが「slop」を今年の言葉に選び、AIによる低品質なコンテンツという語義が新たに辞書に加えられた。
【物理世界への接続と広がり】
画像や文章といったデジタル空間の情報だけでなく、ロボットなど物理的な装置を介して現実世界を認識し、行動するAIのこと。文章や画像などの情報処理を中心とするAIと比べ、フィジカルAIは自らの動作の結果が現実世界に反映される点が大きく異なる。カメラやセンサーから得た情報をもとに周囲の状況を理解し、実際の動作へと反映させる。工場の自動化や自動運転、ヒューマノイドロボットなど、AIの知能を現実の物理空間での作業に応用する分野として関心が高まっている。
クラウド上の高性能なサーバーに処理を任せるのではなく、スマートフォンやカメラ、センサーといった手元の端末(エッジデバイス)でAIの推論処理を実行する仕組みのこと。ネットワークの末端(エッジ)で処理を完結させることが名前の由来。通信環境に左右されず高速で処理できるうえ、端末内で処理を完結させる構成なら取得したデータを外部に送らずに済むので、プライバシー面でも利点がある。工場設備の異常検知や車載カメラでの画像認識など、リアルタイム性が求められる場面で活用が進んでいる。
現実世界の物理法則や事物の関係性、時間の経過に伴う変化などを、AI自身の内部にシミュレーションとして構築する仕組みのこと。目の前の情報を処理するだけでなく、「次に何が起こるか」を予測する能力をもたせることを目指す技術である。ロボットの行動計画や自動運転など、現実世界での意思決定を伴うAIを支える重要な要素として、研究開発が世界的に進められている。
脳の電気的な活動を中心に、磁気や血流の変化なども計測して読み取り、機械やコンピューターの操作に変換する技術のこと。「Brain-Machine Interface(BMI)」または「Brain-Computer Interface(BCI)」と呼ばれる。体を動かさずに義肢やカーソルを操作できることから、主に医療・福祉分野での応用が期待されてきた。近年では、AIによる信号解析の精度が向上したことで、より繊細な意図の読み取りが可能になりつつある。
【進歩の先にあるもの】
特定の作業に特化するのではなく、人間と同じようにあらゆる分野の課題を理解・学習・対応できる汎用的な知能をもつAIのこと。AGIは「Artificial General Intelligence」の略。いま広く使われているAIの多くは、特定の目的に最適化された「特化型AI」にあたる。基盤モデルも幅広いタスクをこなすが、人間のようにあらゆる分野へ自律的に対応できる段階には至っていない。これに対してAGIは、ジャンルを問わず柔軟に思考・判断できる点で一線を画す。ただし、何をもってAGIとするかについて統一された定義はなく、実現時期と合わせて研究者の間でも見解が大きく分かれている。
あらゆる分野において、人間の知能を明確に上回る能力をもつとされる仮説上のAIのこと。ASIは「Artificial Superintelligence」の略。一般的にAGIは幅広い課題に対応する汎用性を、ASIは人間を大幅に上回る能力を指す。もし実現すれば科学研究や社会課題の解決に大きく貢献しうる一方で、人間の制御が及ばなくなるリスクも指摘されており、安全性の確保が活発に議論されている。
AIの知能が人間の知能を超え、技術の進歩が人間の予測や制御の及ばない速度で加速していくとされる仮説上の転換点のこと。「特異点」という言葉はもともと、通常の法則や計算が成り立たなくなる特別な点として、数学や物理学で使われてきた。発明家で未来学者のレイ・カーツワイルが2005年の著書で広めた概念であり、実現する時期や、そもそも到来するのかどうかについては、研究者の間でも意見が分かれている。
(Edited by Daisuke Takimoto)
※『WIRED』による人工知能(AI)の関連記事はこちら。
『WIRED』日本版のポッドキャストを配信中!
編集長による記事の読み解き、雑誌の編集後記、アーティストやクリエイター、SF作家、フードイノベーションのスペシャリストなど、さまざまなゲストを交えたトークをお届け。 最新エピソードはこちらから→ Spotify / Apple Podcast





