Skip to content

DNET_TextGenerationTransformer

nishi_74322014 edited this page Sep 11, 2026 · 1 revision

テキスト生成系(Transformer系)

概要

テキスト生成系(Transformer系)の言語モデル(言語処理(AI))。

詳細

Transformer

言語処理(AI)の該当節も参照。

  • その情報に注目スべきか判断して情報を処理するAttentionの導入。
  • Self-Attention機構の重要性を示し、他の分野にも影響を与えた。
  • 汎用性が高くコレを画像処理に応用したのが、Vision Transformer。

RNN Encoder-DecoderのAttention機構
 同じ目的を達成するが機構は異なる。

アーキテクチャ

  • オートエンコーダ、Attention、全結合層(ニューラルネットワークの該当節を参照)

  • RNN Encoder-Decoder(Sequence-to-Sequence)
    用いないオートエンコーダ・モデル

    • RNNCNNも使わず(再帰も畳込も行わず)に
    • 入力と出力の文章同士の広範囲な依存関係を捉えられる、
    • Attention機構の概念を導入したオートエンコーダ・モデル
  • RNN Encoder-Decoder(Sequence-to-Sequence)の逐次処理を
    オートエンコーダの並列処理に変更して従来モデルの問題を解決。

    • Attention機構をMulti-head Attentionに置き換えた、
    • 「並列化できない」
      「長期記憶ができない(大域的な特徴・ニュアンスを捉え難い)」問題を解決。
      • 並列計算で高速な学習が可能になった。
      • 後半に行けばいくほど昔の記憶を維持するのが難しくなる問題を解決。
      • Positional Encoding(位置エンコーディング)でベクトルに語順情報を付加。

パフォーマンス

RNN Encoder-Decoder(Sequence-to-Sequence)系よりも早くて精度が高い

  • 処理が速い:並列化によって学習時間を大幅に短縮。

    • データを逐次処理する必要がなく、
    • 並列化で訓練時間が圧倒的に削減でき
    • ビッグデータで効率的に学習できる。
  • 精度が高い:英独翻訳タスクで従来モデルの最良結果を超える。

  • 汎用性が高い:汎用的で、大規模なモデルも構築可能

タスクの概要と構造

  • 翻訳タスク
    スペイン語 → 英語

    • Yo tengo gatos → I have cats
    • ...と、catsを予測するTransformer.
  • 入力と出力
    翻訳タスク(Yo tengo gatos → I have cats)

    • 入力

      • Self-Attention:「Yo tengo gatos」
      • Masked Self-Attention:「I have [cats]」※ []はMask
    • 出力

      • 次単語予測(BEAM search):「cats」を予想する。
      • Decoderが通常のSeq2seqのように逐次的に単語を出力していく。
    • 以下の前処理が処理前に行われる。

      • ストップワード削除済み原文
      • Embeding:単語の分散表現(言語処理(AI)の該当節を参照)で512次元のベクトルに圧縮
      • Positional Encoding:単語の順番情報を埋込。
    • Encoderの出力を一気にDecoderに入れる。

  • 構造

    イメージ

    イメージ

    https://qiita.com/omiita/items/07e69aef6c156d23c538

    • Encoder
      文章を意味に変換する。

      • Self-Attention(Multi-head Attention
        1文の単語だけを使って計算された単語間の照応関係を付加

        I have cats
        I 0.88 0.10 0.02
        have 0.08 0.80 0.12
        cats 0.03 0.14 0.83
      • Position-Wise Feed-Forward Networks(PFFN)
        2層のDNN:FFN(x) = ReLU(xW1+b1)W2+b2

    • Decoder
      意味を文章に変換する。

      • Masked Self-Attention(Multi-head Attention)
        予想する単語の部分をマスクした文の単語だけを使って計算された単語間の照応関係を付加

      • Source-Target Attention(Multi-head Attention)
        ここまでの出力をQueryに、Encoderの出力をKeyとValueにして
        Multi-Head AttentionでAttentionを計算し異なる時系列データの照応関係情報を獲得

      • Position-Wise Feed-Forward Networks(PFFN)
        2層のDNN:FFN(x) = ReLU(xW1+b1)W2+b2

      • 全結合層(元の次元に戻す)・Softmax関数(確率分布(p(yi)))
        (いずれも ニューラルネットワークの該当節を参照)

オートエンコーダ

  • 左半分がEncoder

    • N=6層のTransformer Blockで構成されていて、6層とも同じ構造。

    • 各Transformer Block層は2つのサブ層で構成される。

      • Self-Attention(Multi-head Attention)層は文脈を埋込。
        文脈の理解力が高いAttentionの進化版で複数箇所の重要な部分に注目することができる。

      • Position-Wise Feed-Forward Networks層は...
        ・入力はQと同サイズのトークン・ベクトルが並んだ文章で
        ・Position-Wiseは各トークン毎(位置単位)に計算をすると言う意味

    • それぞれのサブ層の後にはAdd&Normがある。

  • 右半分がDecoder

    • N=6層のTransformer Blockで構成されていて、6層とも同じ構造。
    • 各Transformer Block層は2つのサブ層で構成される。
    • 2つのサブ層の間にEncoderの出力を受け取る
      Source-Target Attention(Multi-head Attention)層が追加されている。

イメージ

イメージ

イメージ

https://nlpillustration.tech/?p=2171

Transformer Block

Transformer ≒ Transformer Block

  • RNNのAttention機構と同様に、Q、K、VからAttentionを計算するが、
    RNN Encoder-Decoder(Sequence-to-Sequence)の該当節を参照)
    コチラでは、後述のMulti-head Attentionと言う機構を使用する。

  • 計算結果(Qと同サイズ)をQのAdd&Norm(前述)をする。

  • 計算結果をPosition-Wise Feed-Forward Networksに適用。

  • さらに計算結果(入力と同サイズ)をAdd&Normをする。

  • 最終的なTransformer Blockの出力とする。

イメージ

イメージ

https://agirobots.com/multi-head-attention/

Multi-head Attention

  • Multi-head Attention

    • Single-Head Attention(Scaled Dot-Product AttentionとLinear層からなる)を並列化したもの。
    • 獲得された学習パラメタを可視化すると並列に並んでいる各Single-Headが
      異なる注意表現を獲得している(後述の①)。
    • これは、後述のScaled Dot-Product AttentionのK、Vの値を決める重み、
      出力を調整する重みの学習になる。

    Single-Head Attention

    イメージ

    Multi-head Attention

    イメージ

    Multi-head Attention内部で行われる計算

    イメージ

    イメージ

    1. 行列をかける。Q = K = V = Xなのでそれぞれを変形させる。
      ・QWiq は h=8 なので X の次元を1/8にする。= Xのどの部分を処理するか?を変える。
      ・KWik は内積を取る前に X の角度を変える。= どの部分に注目するか?注目の仕方を変える。
      ・VWiv は出力する前に X の角度を変える。= 出力の様子を調整する。
    2. Scaled Dot-Product Attentionを行う(後述)。
    3. Concatで横に繋げる(1/hにしたものをh倍にする)。
    4. 行列Woをかける。

    https://agirobots.com/multi-head-attention/

  • Single-Head Attention
    HeadとはLinear層3とScaled Dot-Product Attention層1の4つの組合せ

    • Linear層
      Scaled Dot-Product Attention層の直前に学習パラメタを持つLinear層を設け、
      多種多様な特徴部分空間における注意表現を学習可能にする柔軟性を獲得させている。

    • Scaled Dot-Product Attention層

      • 内積に基づく注意計算を行うだけとなっていて内部に学習パラメタを持たない。
      • スケール化内積注意と訳せるだけに、
        内積を利用したベクトル間の類似性に基づく変換を行う注意機構

    イメージ

    イメージ

    • Qは横ベクトルqの縦ベクトル
    • Kは横ベクトルkの縦ベクトル
    • Vは横ベクトルvの縦ベクトル(KV(kv)はペアになっている)

    QをqにしてSingle-Head Attentionで考えると、qtKは、同様に、qkの内積(類似度)の
    横ベクトルになる。また、√dkは、次元が大きくなると長くなるので補正する。
    コレを同様にSoftmaxで重み(Attention_Weight)に変換し、
    この重み(Attention_Weight)とVのdot積=加重和がCi(文脈を加味した単語ベクトル)になる。

    Attention(q, K, V)では、qとkiが似ている場合 Pi≒1 他≒0となる場合、
    kiとの類似度に応じたVの加重和はほぼviになる。Attention(Q, K, V)はバッチで処理。

    https://agirobots.com/multi-head-attention/

  • Concat+Linear層(前述の③、④)

    • Concat
    • Linear:活性化関数が恒等関数(なのでPosition-Wise Feed-Forward Networksがある)

数式のポイントとベクトルの内容

  • 数式のポイント

    • Xは縦ベクトルではなく横ベクトル、WXではなくXW(= tWtX)
    • 詰まる所、以下の様な事をやっているらしい。

    Attention(Scaled Dot-Product Attention)

    イメージ

    K、Vの値を決める重み、出力を調整する重みの学習

    イメージ

    https://www.youtube.com/@AIcia_Solid

  • ベクトルの内容

    文のベクトル

    イメージ

    イメージ

    QKVのベクトル

    イメージ

    QKVから計算して得たCi(文脈を加味した単語ベクトル)

    イメージ

    イメージ

    イメージ

    並列に並んでいる各Single-Headが異なる注意表現を獲得している

    イメージ

    https://agirobots.com/multi-head-attention/

移行メモ: 元ページはこの節の図表を PukiWiki の表組み(横結合 |>| を含む)で
レイアウトしていたが、GitHub Markdown では表現できないため、
図を縦に並べ、見出し的な説明文を各図の前に置いた。

GPT-n

言語処理(AI)の該当節も参照。

アーキテクチャ

  • Encoderを持たず、TransformerのDecoderと似た構造を持つネットワーク

  • TransformerのDecoder側、Masked Multi-Head AttentionとFFNを抽出したブロックを用いる。

イメージ

https://www.youtube.com/@AIcia_Solid

  • Token Embedding、Positional Embedding、Decoder型のTransformer Blockを12層、
    出力層で構成

  • 入出力

    • 入力

      • 分類:Start - 文 - Extract
      • NLI:Start - 文1 - Delimiter - 文2 - Extract
      • Q&A:
        ・Start - 文Q - Delimiter - 文A1(選択肢)- Extract
        ・...
        ・Start - 文Q - Delimiter - 文An(選択肢)- Extract
    • 出力

      • 事前学習では次単語予測
      • ファイン・チューニングではタスク毎に異なる

パフォーマンス

タスクの概要と構造

  • 得意なタスク

    • 次単語予測、文章穴埋
    • 自然言語推論 (NLI) :2テキスト間の推論的関係の同定
    • 分類、意味、文章生成(翻訳、要約、対話生成、Q&A)
    • 計算(足し算・引き算)もできる。
    • ソースコード生成、デザイン支援もできる。
  • 苦手なタスク
    文の意味を人間のように理解していない

    • 比較が苦手
    • 人間社会、物理現象の慣習や常識を認識、推論できない。

事前学習とファイン・チューニング

いずれも 深層学習のテクニックの該当節を参照。

  • 事前学習

    • サブタスクで言語を理解(言語処理(AI)の該当節を参照)。
      • 過去の単語列から次の単語を予測(教師なし学習)
      • 使用するDataSetは、BookCorpus、1B Word Benchmark
      • この大規模なDataSetで100エポックもの学習を行う。
    • その後、僅かな教師あり学習(ファイン・チューニング)で本タスクを学習する。
  • ファイン・チューニング
    少データ、少資源でOKのため、多くの応用が可能。

    • 最終層のみ取り替えて教師あり学習
    • 数例のデータしか必要としないので教師データの作成が楽
    • 学習も3エポック程度の学習で済む。
    • 代替手段となるfew-shot学習は、学習を行っているわけではなく、
      巨大な汎用事前学習モデルの中の学習結果から求められている学習結果を
      引き出しているだけ。

BERT

言語処理(AI)の該当節も参照。
GPT-nを少し改変しているので、高性能で汎用性が高く応用し易い。

  • Google検索(AIの活用例の該当節を参照)
  • Regal BERT(特定ドメイン=法律領域向けのBERTモデル)

アーキテクチャ

  • TransformerのEncoderを双方向多層に積み重ねたアーキテクチャ
    • 双方向(文頭と文末)から学習することによって「文脈を読むこと」が実現された。
    • 膨大な量のテキストデータからテキストの単語の連なりの「言語らしさ」を学習
    • 長く複雑な文章を読み取ることができ文脈を読むことが可能になった

イメージ

https://www.youtube.com/@AIcia_Solid

  • Token / Segment / Positional Embedding、Encoder型のTransformer Blockを24層

    • Et + (Ea or Eb) + Ei

      • Token Embedding(Et)
      • Segment Embedding(Ea or Eb)
      • Positional Embedding(Encoding)(Ei)
    • Encoder型のTransformer Blockを24層

    • 出力層
      事前学習とファイン・チューニングで変更無し。

  • 入出力

    • 入力
      1つ2つの文章を入力

      • 文1 : t1...tn
      • 文2 : t'1...t'm
      • 一文 : CLS 文1 SEP 文2 SEP
      • 二文 : CLS 文1 SEP SEP
    • 出力
      基本的には一文、C T1...TN TSEP T'SEP

      • 文単位のタスク(分類問題など)ではC(文章の意味ベクトル)を使用
      • 単語単位のタスク(固有表現抽出(NER)など)ではT1...TN(単語の意味ベクトル)を使用

パフォーマンス

高性能で汎用性が高く応用し易い。

  • TransformerベースのGPT-nベース

    • Transformerは凄い
    • 事前学習とファイン・チューニングは凄い
  • 上記に加えて双方向が凄い
    上位の層では意味・文脈に関する抽象化された情報を獲得

タスクの概要と構造

マスクされた単語の前後のテキストを使って単語を予測する。

  • 元々は機械翻訳で利用されていた。
  • 今は自然言語処理なら大概できる。
    • 質問応答(質問に対する回答を文書中から見つけてくる)
    • 文の比較(片方の文がもう一方の文の内容を含んでいるか)

事前学習とファイン・チューニング(BERT)

基本的にGPTの事前学習とファイン・チューニングと同じ。

  • 事前学習に工夫をしている。

    • 単語・文法を学習:15%マスクされた単語の予測を学習(MLM)
    • 文意・文脈を学習:連続する2文であるかないか(5:5)判断を学習(NSP)
  • チューニング
    実現したいタスクに応じた数百レベルの学習データを用意してファイン・チューニング

    • 事前学習結果を実際に使う場合。
    • BERTの上にタスク依存の層を重ねる。
    • 数百件レベルの学習データで実施可能

リソースと時間が必要なので学習済みモデル(汎用事前学習モデル)をGoogleが無償で公開

GPTのバージョン

2019年にGPT-2、2020年にGPT-3
202n年にGPT-3.5、202n年にGPT-4が発表

GPT-2

  • 概要

    • 【論文】Language models are unsupervised multitask learners.
      特定のタスクに特化するのではなく、色々なタスクに応用できる、
      できるだけ汎用的なモデルを構築する事を目指す。

    • 事前学習とファイン・チューニングが面倒なので、
      なんかすっごいの1つ作って、ソレで全部なんか出来ない?

    • 言語モデル(次単語予測)の可能性
      Commonsense reasoning(常識的な推論)を解ける。

    • 大モデル、大データならもっと凄いのではないか?
      結果、半分凄い、半分まだまだ。この方向性に大きな可能性(GPT-3へ)。

  • モデル

    イメージ

    https://www.youtube.com/@AIcia_Solid

    • ほとんどGPT-1と同じ。
    • タスクは翻訳ではなく次単語予測
    • 一番大きいものでTransformer Blockブロックが12 → 48
    • Add&Normの位置が少々異なる。
      • Add:残差接続の位置の変更
      • Norm:Layer Normalizationの位置の変更
  • データ

    • WebTextコーパスを新規に開発
    • 量と質と幅(様々な話題と文脈)
    • 約800万のウェブページから抽出された高品質自然言語テキストコーパス
    • 3つ以上のカルマを持つRedditの発信リンクからのWebページ(8Mリンク、40GB)
  • 性能
    8タスク

    • 言語モデル(次単語予測)

      • 8つ中、7データセットでSoTA
      • Perplexity予測性能:10-40
    • Children's Book Test (CBT)
      10選択単語穴埋めタスクでSoTA

    • LAMBADA Benchmark
      最後の単語を予測するタスクでSoTA

    • Winograd Schema Challenge

      • Commonsense reasoning(常識的な推論)でSoTA
      • ポイントは教師データを使用していない点
    • CoQA

      • 会話型質問応答システムを構築するための大規模なデータセット
      • TOEICのようなテストの質問と回答を最高性能に匹敵
      • 同様に、ポイントは教師データを使用していない点
    • Summary

      • 長文の要約を作る。
      • 長文+TL;DRを入力。
    • Translate

      • WMT-14の仏→英がBLEU:11.5(当時の最高は40ぐらい)
      • ただしデータは英語のみで仏データが僅か10M程度しか混じって無かったのにも関わらず。
    • QA
      1問1答はまったくSoTAに届いていないが、
      一番小さなモデルで1%、一番大きなモデルで4%と、
      大モデル、大データならもっと凄いのではないか?と言う可能性。
      (実は、WebTextに対して未学習(もっとモデルを複雑にしたら...))

GPT-3

  • 概要

    • 【論文】Language Models are Few-Shot Learners
    • BERTに比べてあまりにも巨大
    • 時代背景
      • Scaling Law:大きなTransformerは強い。
      • NLP & DL:
        ・DL:数十万件のデータが必要
        ・PT & FT:1,000件程度のデータで済む。
        ・FS(Few-Shot):10件程度のデータで済む。
  • モデル
    GPT-2 + Sparse Transformer

    • Sparse Transformer(Sparse Multi-Headed Attention)
      チェック・ポイント以前はチェック・ポイントのみ参照する。

    イメージ

    https://www.youtube.com/@AIcia_Solid

    • 1750億(175B)のパラメタ(GPT-2:1.5B、T5:11B)
    • ベクトルの次元:12288(GPT-2:1600)
    • Transformer Block層:96(GPT-2:48)
    • Multi-head Attentionのヘッド数(nhead):96
    • Single-Head Attentionの次元?(dhead):128
    • トークン数:2048
    • バッチサイズ:3.2M
    • 学習率:6e^-1
  • データ

    • 約45TBの大規模データセットを前処理した
      約570GBテキストデータ(GPT-2:40GB)

      • Common Crawl(をCleaningしたもの)
      • Wikipedia
      • Books1, Books2
      • WebText(GPT-2)
    • 上記中の300Bトークンで事前学習

  • 特性
    大規模言語モデル(LLM)の創発的な特性

    • コンテキスト内学習

      • 手法はGPT-3の登場にともない一般に普及した大規模言語モデルの創発的な特性で、
      • 与えられたコンテキスト内で情報を学習し、その学習を元に出力を生成する。
      • 何故かはよく解っていないので下の様な絵で説明されてたりする。

      イメージ

      https://www.youtube.com/@AIcia_Solid

    • GPT-3におけるFew / One / Zero-Shotの説明
      ・≒ コンテキスト内学習でファインチューニングと異なりパラメタ更新は不要。
      ・Attention機構を変形して見方を変えると勾配降下法をシミュレーションしている。
      ・モデルがタスクを試みる前に例を処理できるようにするプロンプトとしてコンテキストを与える。

      • Few-Shot(FS)
        ・推論時にタスクに関する説明と少量のデモンストレーションを与える方式
        ・パラメタを更新しない=デモを学習しない=デモを過学習しない。
      • One-Shot(1S)
        ・Few-shotのデモンストレーションの数が1つであるケース
        ・人が例示を見てタスクに取り組むという状況に近い
      • Zero-Shot(0S)
        ・推論時にはタスクに関する説明のみが与えられる。
        ・デモンストレーションは全く与えられないケース
      一般的な扱い GPT-3での扱い
      Few / One-Shot 少量の教師ありデータに基づく学習方法 タスク説明と少量のデモンストレーションを入力とした予測
      Zero-Shot 学習時に存在しないクラスのデータを扱う枠組み タスク説明のみを入力とした予測
  • 性能
    9タスク、得意と苦手がある。

    • Language Model, Cloze, Continuation Tasks SOTA有り

    • Closed Book Question Answering SOTA有り

      • 関連文書から正解の可能性が高い文字列を抜き出すことによって解答する(Open-book)のではなく、
        関連文書を用いないで与えられる質問について何を知っているかを直接問う(Closed-book)
      • TriviaQA:T5 < 0S < 旧SOTA < 1S < FS
    • Translation En SOTA有り

      • FS ≒ 教師なし SOTA < 教師あり SOTA
      • 非英語データは7%、英語に翻訳する方が精度が高い。
    • Winggrad-Style Tasks SOTA有り

    • Common Sense Reasoning △

    • Reading Comprehension ◯☓

    • Super GLUE ◯☓
      単語は2つの文書で同じ使われ方をしているか?

    • Natural Language Inference ☓
      2番目の文書は1番目の文章の賛成 / 反対 / 中立のどれか?

    • Synthetic and Qualitative Tasks ◯☓

      • 2桁の±が99-100%
      • 3-5桁の±、2桁の*、1桁の±, *, ()が20%
    • News Article Response
      タイトル・サブタイトルから人間と区別できない文書を生成

  • 課題

    • 何故か2文間の比較を要するタスクが苦手

    • 文書生成で
      ・単語単位の繰り返しは無いが。
      ・文単位の繰り返しがある。
      ・長文の一貫性に欠ける。

    • 双方向性
      双方向性は無いので文の後ろを考慮しない(コンテキストが読めない)。

    • Pre-Training objective
      次単語予測の事前学習の精度はScaling Lawで上がるが
      Scaling Lawの頭打ちや実問題での性能(次単語予測以外の事前学習)

      • 人間から学ぶ
      • 強化学習でチューニング
      • マルチ・モーダルでやる
    • 学習の効率化
      GPT-3は300Bトークンで学習するが、
      人間は生涯で0.3Bトークンの入力程度(1000倍の差)

    • Few-Shotで何が起きる?
      ・学習済みの内容を思い出している。
      ・新しい能力を獲得している。

    • 解釈・制御
      DLと同じ(人間も直感では同じ)。

    • バイアス
      データのバイアスを受け継いでいる。

移行メモ(正誤): 元ページの「Pre-Training dejective」は
「objective」の誤記と判断し修正した。

GPT-3.5

  • 概要
    ChatGPT における対話の応答精度が大幅に向上。

    • OpenAI が 2022 年末にリリースした大規模言語モデル(LLM)で、GPT-3 系列の改良版
    • ChatGPT の 無料プラン(2023年時点)で使われていたモデルで、
      GPT-4 の登場前に主に利用された
    • GPT-3.5-turbo は、従来の GPT-3(175Bパラメタ)と比べ高速・低コストが特徴。
  • モデル

    • ベースは GPT-3(Decoder-only Transformer アーキテクチャ)
    • パラメタ数は非公開だが、GPT-3(175B)と同等またはやや小さい可能性がある。
    • Chat 対応に最適化(Instruction tuning、RLHFを使用)
  • データ

    • インターネット上のテキストデータ(Webページ、書籍、Wikipedia、コードなど)
    • 2021年9月頃までのデータで学習(GPT-3の最終データセットとほぼ同等)
    • 一部のコードデータ(GitHub など)も含む
  • 性能

    • GPT-3 に比べて 指示理解、コーディング、会話の一貫性が向上
    • ただし複雑な論理推論や事実性においては GPT-4 に劣る
    • ChatGPT(無料版)として広く普及し、実用レベルに到達

GPT-4

  • 概要

    • OpenAI が 2023年3月に発表した次世代大規模言語モデル
    • 前世代の GPT-3.5 よりも大幅に改善されており、
      論理推論・事実性・多言語能力・視覚入力対応(GPT-4V)などが特徴。
    • GPT-4 Turbo は GPT-4 の派生で、より効率的で安価なモデル(ChatGPT Plusで使用)
  • モデル

    • Transformerベースだが、アーキテクチャの詳細・パラメータ数は非公開
      (GPT-4のパラメータ数は未公表)
    • Chatやタスク指向に特化(Instruction tuning + RLHF)
    • マルチモーダル対応(画像+テキスト)
    • GPT-4 Turboでは 最大128kトークンのコンテキスト長
  • データ

    • Web、書籍、コード、学術文献、ニュースなど多様なデータ
    • 2023年4月までのデータを含む(GPT-4 Turbo)
    • GPT-3.5 よりも 最新かつ多様なソースで訓練
    • 安全性とバイアス制御のフィルタリング強化
  • 性能

    • 大規模化は頭打ち
    • 複雑なタスクの推論、計算、説明能力に優れる
    • 大学入試や法律試験でも高得点を記録
    • 多言語能力が向上(日・独・仏でも高精度)
    • GPT-3.5 よりも一貫性・事実性・創造性が高い

サービス・ブランド

  • 2022年11月に公開されたサービス・ブランド。当初は、GPT-3.5。
  • GPT-3.5/GPT-4(GPT-4o)を用いた代表的なSaaS

GPT-4系(OpenAI)ベースのAI。Office統合も進む。

Google Gemini

GPTとは別系列で、PaLM → Geminiモデル。Workspace統合も進む。

Grok / X

GPTとは別系列で、X(旧Twitter)上で動作する、xAI独自モデル(Grok)

Claude

GPTとは別系列で、Claude 3系モデル。

DeepSeek

GPTとは別系列で、中国発。GPTに類似した構造だが独自開発。

さまざまなLLM

パラメタ数

1B →10倍→ 10B →10倍→ 100B →10倍→ 1T →10倍→ 10T
GPT-2や最小のOSSモデル 小さなOSSモデル GPT-3や大きなOSSモデル GPT-4 フロンティア・モデル

モデルの違い

  • GPT系以外にも、LLaMA系、Claude系、Gemini系、Phi系などがある。
  • 基本的には、GPT系のTransformer Decoderのアーキテクチャ
  • 長文強化、MoE・検索統合などアーキテクチャに若干の違いがある。
  • さまざまなブランドがある。
  • 学習データ、パラメタ数、モデル効率などに違いがある。
    (いずれも OSSのLLMの該当節を参照)

フロンティアLLM

サービス・ブランド

比較、ベンチマーク

  • 比較項目

    • 選定基準

      • Open or Close
      • リリース日、知識カットオフ(訓練データの最終時点)
      • パラメタ数と学習トークン数(※ チンチラ・スケーリング則)
      • ウィンドウサイズ
      • 推論コスト(費用/性能)
      • 開発(学習/ビルド/リリース)コスト
      • ライセンス(特に、OSSの商用利用時)
    • ベンチマーク

      • 限界

        • 明確なレギュレーションが無い
        • 対象範囲が狭すぎる(つまり網羅的でない)
        • 微妙な推論を測定するのが難しい(良い推論・悪い推論)
        • 学習・推論で同じデータを使用(つまり学習データの漏洩)
        • (ベンチマーク問題に)過剰適合
        • 証明されていない懸念事項
          (LLMが評価されていることを知ったうえで学習/回答している)
      • 共通的

        ベンチマーク 評価対象 説明
        ARC 推論 科学的推論能力を評価、多肢選択問題
        DROP 言語理解 テキストから詳細を抽出し、加算、計数、または並べ替えを行う
        HellaSwag 常識 難しい結末、長い文脈、そして低得点のアクティビティ
        MMLU 理解 57科目における事実の想起、推論、問題解決能力
        TruthfulQA 正確性 敵対的な状況において真実の回答を提供する堅牢性
        Winogrande 文脈 LLMが文脈を理解し、曖昧さを解決できるかをテスト
        GSM8K 数学 小学校および中学校で教えられる数学と文章題
      • 専門的

        ベンチマーク 評価対象 説明
        ELO チャット チェスにおけるELOのように、他のLLMとの直接対決の結果
        Human Eval Pythonコーディング docstringに基づいてコードを記述する164の問題
        MultiPL-E より広範なコーディング Human Evalを18のプログラミング言語に翻訳
      • 次世代

        ベンチマーク 評価対象 説明
        GPQA 大学院テスト 448問の専門問題。博士号取得者以外ではWebアクセスがあれば34%の得点率
        BBHard 将来的な能力 法学修士課程修了者の能力を超えていると考えられていた204問
        Math Lv 5 数学 高校レベルの数学競技問題
        IFEval 難しい指示 「400語以上記述する」「AIを少なくとも3回言及する」など
        MuSR 多段階ソフト推論 1,000語の殺人ミステリーを分析し、「誰が手段、動機、機会を持っているか?」と問うような論理的推論
        MMLU-PRO より高度なMMLU MMLUのより高度で洗練されたバージョン。選択肢は4つではなく10個。
  • Leaderboard系サイト

  • 一般AIソリューションのパフォーマンス評価

    • モデル中心または技術的指標

      • 損失(例:クロスエントロピー損失)
      • Perplexity
      • Accuracy
      • Precision, Recall, F1
      • AUC-ROC
      • 最適化が最も容易な指標
    • ビジネス中心または成果指標
      ビジネス目標に結びついたKPI

      • ROI
      • 時間、リソース、コスト
      • 顧客満足度
      • ベンチマーク比較
      • 最も具体的な影響

チャットUI

開発系

  • WebUIは無し
  • Azure OpenAI API
  • Azure AI サービス SDK

チューニング / 拡張

LLM界隈の学習系コンテンツ

Udemyの英語版は、公開コンテンツ(GitHub)もあるしなかなか良い。

参考

ゼロつく2

言語処理(AI)の該当節を参照。

Qiita

YouTube

以下はブログ側


Tags: 移行, AI, LLM, Transformer, 開発基盤

NetDevInfraWiki

マイクロソフト系技術情報 Wiki
Open 棟梁 Wiki

(未着手)

開発基盤部会 Wiki

移行管理: DONETODO

Clone this wiki locally