読み切り
16,657字 約34分 42 PV

表示設定

文字サイズ
行間
フォント
背景
文字方向

LLMのことなんて、どうせお前にはわかんねぇだろ……。

16,657字 · 約34分
わかんないよ……。

(ドンッ!)

わっかんないよ!!

LLMのことはひとつもわかんないよ!

文章をいっぱい読ませて、次に来る単語を予測する、それだけじゃないの!?

なのにTransformerって何!?

Attentionって何!?

Self-Attentionって何!?

Cross-Attentionって何!?

Multi-Head Attentionって何!?

注意するだけなのに種類が多すぎるよ!

そもそも次の単語を当ててるだけなのに、なんで質問に答えたり、コードを書いたり、要約したり、翻訳したりできるの!?

次の単語予測と推論能力の間に何があるの!?

「創発しました」って何!?

どこから湧いてきたの!?

誰も実装してない機能が、モデルを大きくしたら急に出てくるって何!?

大きくすれば賢くなるの!?

パラメータ数を増やせば増やすほどいいの!?

七十億、百三十億、七百億、何千億って何!?

数が大きすぎて何もわからないよ!

パラメータって何を数えてるの!?

知識の数なの!?

神経細胞の数なの!?

ただの重みの個数なの!?

重みが一千億個あると、どうして文章が書けるの!?

一個一個はただの小数じゃん!

小数を大量に並べたら知識になるって何!?

知識は重みに保存されてるの!?

でも「正確な知識データベースではありません」って何!?

覚えてるの!? 覚えてないの!?

学習データの文章を丸暗記してるの!?

でも丸暗記だけではないって何!?

一般化してるって何!?

似た文章を混ぜて出してるだけじゃないの!?

創造してるの!?

補間してるの!?

推論してるの!?

確率的に続きを出してるだけなの!?

結局どれなの!?

「全部ある程度正しいです」って答えないでよ!

Transformerもわかんないよ!

Encoderって何!?

Decoderって何!?

Encoder-Decoderって何!?

Encoder-only、Decoder-only、Encoder-Decoderって、同じTransformerなのに三種類あるの!?

BERTはEncoderで、GPTはDecoderで、T5は両方って何!?

何をエンコードして、何をデコードしてるの!?

GPTはDecoderしかないのに、入力を理解できるのは何でなの!?

デコードしかしてないんじゃないの!?

「Decoderという名前ですが入力も処理します」って何!?

名前を直してよ!

Attention is All You Needって何!?

本当に全部Attentionでいいの!?

MLPもあるじゃん!

LayerNormもあるじゃん!

残差接続もあるじゃん!

埋め込みもあるじゃん!

全部Attentionじゃないじゃん!

タイトルで言い切らないでよ!

Self-Attentionもわかんないよ!

Query、Key、Valueって何!?

検索なの!?

データベースなの!?

文章を読んでるだけなのに、何を問い合わせてるの!?

QueryとKeyの内積を取って、Valueを重み付き平均するって何!?

どうしてそれで文脈がわかるの!?

「私は銀行でお金を下ろした」の銀行と、「川の銀行みたいな岸」の違いが、内積でわかるって何!?

単語同士を掛け算したら意味が出るの!?

スケールド・ドットプロダクト・アテンションって何!?

名前が長すぎるよ!

平方根で割るって何!?

割らないと値が大きくなってSoftmaxが飽和するって何!?

急に数学の機嫌を取らないでよ!

Softmaxって何!?

全部を足して一になるようにするだけじゃないの!?

Attentionの重みが確率みたいになるって何!?

でも確率とは限らないって何!?

じゃあ何なの!?

Attention weightを可視化すればモデルの判断理由がわかるって言ったじゃん!

でもAttentionは説明ではないって何!?

見ればいいの!? 見ても意味ないの!?

Multi-Headもわかんないよ!

Headを増やすと複数の関係を学べるって何!?

一つのHeadは主語を見る、別のHeadは目的語を見る、みたいな話なの!?

実際にはそんな綺麗に役割分担してないって何!?

じゃあHeadは何をしてるの!?

一部のHeadを消しても性能が落ちないって何!?

必要ないHeadがいるの!?

何のために学習したの!?

全部同じようなAttentionをしてるHeadもあるって何!?

じゃあ一個でいいじゃん!

Headの数は八、十二、十六、三十二って、どうやって決めるの!?

割り切れる数字なら何でもいいの!?

埋め込み次元をHead数で割れないと怒られるって何!?

意味じゃなくて割り算の都合なの!?

位置情報もわかんないよ!

Transformerは単語の順番がわからないって何!?

文章を左から入れてるじゃん!

順番に並んでるじゃん!

なのにPositional Encodingを足さないと、「犬が人を噛んだ」と「人が犬を噛んだ」の違いがわからないって何!?

見たらわかるでしょ!

Sinusoidal Positional Encodingって何!?

サインとコサインを足したら順番がわかるって何!?

三角関数が文章の語順を持ってるの!?

学習可能な位置埋め込みでいいって言ったじゃん!

でも長い系列に外挿しづらいって何!?

RoPEって何!?

回転位置埋め込みって何!?

ベクトルを回転させると単語間の距離が表現できるって何!?

文章を回さないでよ!

ALiBiって何!?

Attentionのスコアに距離ペナルティを足すって何!?

位置表現だけで方式が多すぎるよ!

RoPE Scalingって何!?

元のコンテキスト長より長く使いたいから座標を引き伸ばすって何!?

引き伸ばして大丈夫なの!?

画像を無理に拡大するみたいに壊れないの!?

コンテキストウィンドウもわかんないよ!

四千、八千、三万二千、十万、百万トークンって何!?

長ければ長いほどいいんじゃないの!?

でも長いと遅い、高い、真ん中を忘れるって何!?

覚えられるって宣伝してるのに忘れるの!?

Lost in the Middleって何!?

最初と最後は覚えてるけど真ん中は弱いって何!?

人間みたいな忘れ方しないでよ!

コンテキストに入っているのに使えないことがあるって何!?

見えてるなら読んでよ!

長文を全部入れればRAGはいらないって何!?

でも全部入れるとノイズが増えるって何!?

じゃあどれを入れればいいの!?

トークンもわかんないよ!

文字じゃないの!?

単語じゃないの!?

日本語一文字が一トークンのときもあれば、複数文字で一トークンのときもあるって何!?

英語は短くて、日本語はトークンを多く消費することがあるって何!?

同じ意味なのに料金が違うの!?

BPEって何!?

Byte Pair Encodingって何!?

よく出る文字列をくっつけるだけなの!?

そんな方法で言語を理解できるの!?

SentencePieceって何!?

WordPieceって何!?

Unigram Language Modelって何!?

トークナイザーまで種類が多すぎるよ!

同じ文章でもモデルごとにトークン数が違うって何!?

じゃあコンテキスト長を文字数で考えちゃ駄目なの!?

特殊トークンって何!?

BOS、EOS、PAD、UNK、SEP、CLSって何!?

アルファベットばっかり増やさないでよ!

チャットテンプレートって何!?

ユーザーとアシスタントの文章を特殊トークンで囲むって何!?

テンプレートを間違えると性能が落ちるって何!?

モデルは同じ文章を読んでるんじゃないの!?

改行や記号が違うだけで挙動が変わるの!?

そんなに繊細なの!?

埋め込みもわかんないよ!

単語をベクトルにするって何!?

意味が数字の列になるって何!?

「王」マイナス「男」プラス「女」で「女王」に近づくって話、いつまで使うの!?

本当に全部そんな綺麗にできるの!?

埋め込み空間では意味が近いものが近くなるって何!?

近いって何メートルなの!?

コサイン類似度って何!?

角度が近ければ意味が近いって何!?

長さは無視していいの!?

ユークリッド距離じゃ駄目なの!?

モデルによって埋め込み空間が違うって何!?

同じ文章なのに座標が違うの!?

ベクトルデータベースもわかんないよ!

データベースに文章を入れたいだけなのに、なんでベクトルに変換するの!?

近傍探索って何!?

似てる文章を探すだけなのに、HNSW、IVF、PQって何!?

近似最近傍って何!?

正確に一番近いものを探さないの!?

近似でいいの!?

検索結果を間違えたらLLMも間違うじゃん!

RAGもわかんないよ!

検索して、その結果をプロンプトに入れるだけじゃないの!?

なのにRetriever、Reranker、Chunking、Embedding、Vector Store、Query Expansionって何!?

部品が多すぎるよ!

チャンクサイズはいくつが正解なの!?

小さいと文脈が切れる、大きいと検索精度が落ちるって何!?

オーバーラップを入れろって何!?

同じ文章を重複して保存するの!?

重複した結果が何個も返ってくるじゃん!

Metadata Filterって何!?

Hybrid Searchって何!?

DenseとSparseを混ぜるって何!?

BM25でいいの!?

ベクトル検索がいいの!?

両方やってRerankしろって何!?

検索だけで何段階あるの!?

RerankerにCross-Encoderを使うって何!?

検索の結果を、また別のモデルで読み直すの!?

最初のEmbeddingモデルは何だったの!?

RAGならハルシネーションを防げるって言ったじゃん!

でも検索結果を無視して答えることがあるって何!?

引用を付けても、引用元に書いてないことを言うって何!?

根拠を渡してるのに使わないの!?

Faithfulnessを評価しろって何!?

正解性と忠実性は別って何!?

正しいけど資料に書いてない回答と、資料には忠実だけど間違った回答は、どっちがいいの!?

ハルシネーションもわかんないよ!

知らないなら知らないって言えばいいじゃん!

なんでそれっぽく答えるの!?

次のトークン確率が高い文章を出してるだけだからって何!?

自信と正しさが一致しないって何!?

間違ってるのに断言するのやめてよ!

Temperatureを下げれば嘘が減るって何!?

でもゼロにしても間違うって何!?

決定的に間違うようになるだけじゃん!

「モデルに知識がない」のか、「知識はあるけど取り出せない」のか、「質問を誤解した」のか、「推論に失敗した」のか、どうやって見分けるの!?

全部同じような間違いに見えるよ!

デコーディングもわかんないよ!

一番確率が高いトークンを選べばいいじゃん!

なのにGreedy、Beam Search、Top-k、Top-p、Temperature、Typical Samplingって何!?

文章を出すだけなのに設定が多すぎるよ!

Temperatureって何!?

温度を上げると創造的になるって何!?

冷やすと真面目になるの!?

モデルの性格を温度で決めないでよ!

Top-pって何!?

確率の合計がpになるまで候補を残すって何!?

Top-kとは何が違うの!?

両方同時に使うの!?

どっちが先なの!?

Repetition Penaltyって何!?

同じことを繰り返すから罰を与えるって何!?

Presence PenaltyとFrequency Penaltyは何が違うの!?

罰の種類まで多いよ!

Beam Searchは翻訳では強いけど、自由生成では退屈になるって何!?

探索を丁寧にすると文章がつまらなくなるの!?

Speculative Decodingって何!?

小さいモデルに下書きさせて、大きいモデルが採用するって何!?

二つモデルを動かして速くなるって何!?

普通は遅くなるでしょ!

KV Cacheもわかんないよ!

過去のKeyとValueを保存すると生成が速くなるって何!?

Queryは保存しなくていいの!?

文章が長くなるほどKV Cacheが巨大になるって何!?

重みよりキャッシュがメモリを食うことがあるって何!?

モデルを読み込めたのに、長文を生成したらメモリ不足になるの!?

PagedAttentionって何!?

キャッシュをページ単位で管理するって、急にOSみたいなことしないでよ!

Continuous Batchingって何!?

違う長さのリクエストを途中から同じバッチに入れるって何!?

バッチは最初にまとめるものじゃないの!?

FlashAttentionって何!?

Attentionを高速化するって何!?

近似じゃないのに速いって何!?

メモリアクセスを減らしただけって何!?

計算量は同じなのに実行速度が違うって何!?

じゃあ今まで何に時間を使ってたの!?

深層学習もわかんないよ!

層を増やせば賢くなるんじゃないの!?

でも深くしすぎると学習しないって何!?

勾配消失って何!?

勾配爆発って何!?

消えたり爆発したりしないでよ!

残差接続を入れれば学習しやすいって何!?

入力をそのまま足すだけで深いモデルが動くようになるって何!?

そんな単純なことで直るの!?

LayerNormって何!?

各トークンの特徴を正規化するって何!?

RMSNormって何!?

平均を引かなくてもいいって何!?

じゃあLayerNormの平均は何だったの!?

Pre-NormとPost-Normって何!?

正規化をAttentionの前に置くか後に置くかで学習安定性が変わるって何!?

足し算の順番だけじゃないの!?

MLPもわかんないよ!

Attentionの後に線形層を二回通して活性化するだけじゃないの!?

なのにFeed Forward Networkって呼んだり、MLPって呼んだり、FFNって略したりしないでよ!

GELUって何!?

ReLUでいいじゃん!

SwiGLUって何!?

GLU、GEGLU、SwiGLUって何個作るの!?

ゲートを付けると性能が上がるって何!?

Transformerの計算の大半はAttentionじゃなくてMLPにあることも多いって何!?

Attention is All You Needじゃなかったの!?

学習もわかんないよ!

大量のテキストを集めて、次トークン予測で学習すればいいんじゃないの!?

でもデータの品質が大事って何!?

量なの!? 質なの!?

重複を除去しろって何!?

同じ文章を何度も学習すると暗記するって何!?

でも重要な情報は繰り返した方が覚えるんじゃないの!?

有害コンテンツを除去しろ、低品質文書を除去しろ、個人情報を除去しろって何!?

除去しすぎると能力が落ちるって何!?

じゃあ何を残せばいいの!?

コードを混ぜると推論能力が上がることがあるって何!?

プログラミングと言語推論に何の関係があるの!?

数式データを増やせば数学が強くなるって何!?

でも答えだけ暗記しても駄目って何!?

推論過程を学習させるの!?

間違った推論過程を混ぜたらどうなるの!?

データ汚染もわかんないよ!

ベンチマークの問題が学習データに入ってたら評価できないって何!?

インターネットから集めたら入ってるかもしれないじゃん!

完全に確認できないって何!?

じゃあ高スコアでも暗記かもしれないの!?

問題文を少し変えて性能が落ちたら暗記なの!?

でも言い換えで難易度も変わるじゃん!

汚染されていない新しいベンチマークを作っても、公開したら次のモデルの学習データに入るって何!?

評価セットが使い捨てじゃん!

事前学習もわかんないよ!

学習率、バッチサイズ、トークン数、モデルサイズを全部調整するの!?

Scaling Lawsって何!?

モデル、データ、計算量を適切な比率で増やせって何!?

モデルだけ大きくしても駄目なの!?

データが足りないとUndertrainedって何!?

何兆トークン読ませても足りないの!?

一回の学習に何週間も何か月もかかるって何!?

途中でバグが見つかったらどうするの!?

最初からやり直すの!?

損失が少しおかしいけど学習は進んでいるって何!?

止めるの!? 続けるの!?

何億円分の計算を賭けて判断するの!?

分散学習もわかんないよ!

GPU一枚で入らないから複数枚に分けるって何!?

Data Parallel、Tensor Parallel、Pipeline Parallel、Sequence Parallelって何!?

並列化にも種類が多すぎるよ!

ZeROって何!?

Stage 1、Stage 2、Stage 3って何!?

Optimizer State、Gradient、Parameterを分割するって何!?

何をどこに置いたかわからなくなるよ!

FSDPって何!?

DeepSpeedとは違うの!?

Megatron-LMって何!?

名前が強すぎるよ!

All-Reduceって何!?

GPU同士で勾配を共有するだけなのに通信がボトルネックになるって何!?

計算する機械を増やしたら、相談する時間の方が長くなるの!?

Pipeline Bubbleって何!?

GPUが待ってる時間ができるって何!?

高いGPUを休ませないでよ!

Gradient Accumulationって何!?

小さいバッチを何回か足して、大きいバッチみたいにするって何!?

同じじゃない場合もあるって何!?

BatchNormがなければ近いって何!?

近いじゃなくて同じにしてよ!

混合精度もわかんないよ!

FP32、FP16、BF16、FP8って何!?

数字を小さくすれば速くなるの!?

でも精度が落ちたりNaNになったりするって何!?

BF16は指数部が広いから安定って何!?

FP16は仮数部が多いから細かいって何!?

どっちがいいの!?

Master WeightだけFP32で持つって何!?

一つのモデルの中に複数の精度が混ざってるの!?

Loss Scalingって何!?

小さすぎる勾配を大きくしてから戻すって何!?

消えるなら最初から消えない形式で計算してよ!

Fine-tuningもわかんないよ!

事前学習済みモデルに自分のデータを追加で学習させればいいんじゃないの!?

でもFull Fine-tuningは重いって何!?

LoRAって何!?

低ランク行列を差し込むだけで学習できるって何!?

元の重みを変えなくても性格や知識が変わるの!?

低ランクで十分って何!?

じゃあ元の巨大な重みは何なの!?

Rankはいくつが正解なの!?

八、十六、三十二、六十四って何!?

大きいほど表現力が上がるけど重くなるって、また調整なの!?

LoRAをどの層に入れるの!?

QとVだけでいいの!?

KもOも入れるの!?

MLPにも入れるの!?

全部試せって何!?

QLoRAって何!?

量子化したモデルにLoRAを付けるって何!?

四ビットに圧縮したまま学習できるの!?

でも計算時には復元するって何!?

圧縮してるの!? してないの!?

NF4って何!?

Double Quantizationって何!?

量子化定数まで量子化するって何!?

どこまで小さくするの!?

SFTもわかんないよ!

Instruction Tuningって何!?

質問と回答のペアを学習させるだけじゃないの!?

でも形式が大事、品質が大事、多様性が大事って何!?

同じ能力でもプロンプト形式を変えると答えられなくなるって何!?

学習したテンプレートに依存してるの!?

会話データを入れすぎると、何でも会話っぽく返すって何!?

コードだけ出してほしいのに説明を始めるのやめてよ!

Alignmentもわかんないよ!

人間の意図に沿わせるって何!?

誰の意図なの!?

世界中の人間の価値観が同じだと思ってるの!?

RLHFって何!?

人間の好みを学習して、報酬モデルを作って、PPOで最適化するって何!?

工程が多すぎるよ!

人間が回答を順位付けするって何!?

評価者によって好みが違ったらどうするの!?

長くて丁寧な回答が選ばれやすいから、モデルが冗長になるって何!?

人間の評価の癖まで学習するの!?

Reward Hackingって何!?

報酬を上げる方法だけ覚えて、本来の目的を外すって何!?

点数を付けるとズルを覚えるの!?

PPOもわかんないよ!

クリップして更新を安定させるって何!?

KLペナルティで元のモデルから離れすぎないようにするって何!?

変えたいのに変わりすぎるなって何!?

DPOって何!?

報酬モデルなしで好みを直接最適化できるって何!?

じゃあRLHFの複雑な工程は何だったの!?

IPO、KTO、ORPO、SimPOって何!?

好み最適化の手法まで増えすぎだよ!

どれが正解なの!?

ベンチマークではDPOが強いけど、用途によるって何!?

いつも用途によるじゃん!

Chain of Thoughtもわかんないよ!

途中の考えを書かせると正答率が上がるって何!?

考えてから答えると賢くなるの!?

モデルは文章を出しながら考えてるの!?

それとも考えたふりをしてるの!?

途中の推論が間違ってるのに答えだけ合ってることがあるって何!?

答えが間違ってるのに推論がもっともらしいこともあるって何!?

じゃあ推論過程を見ても信用できないの!?

「理由を説明してください」って頼めば説明できるけど、本当の内部理由ではないって何!?

じゃあ何を説明してるの!?

Self-Consistencyって何!?

何回も答えさせて多数決を取ると強くなるって何!?

一回では信用できないの!?

十回考えさせれば賢くなるけど、料金も十倍って何!?

Tree of Thoughtsって何!?

Graph of Thoughtsって何!?

思考を木やグラフにしないでよ!

普通に考えてよ!

Reasoning Modelって何!?

長く内部計算すると難しい問題に強くなるって何!?

計算時間を増やせば正答率が上がるの!?

Test-time Computeって何!?

学習後も推論時に計算量を増やすの!?

モデルサイズだけじゃなく、考える時間まで調整するの!?

どこまで考えさせればいいの!?

長く考えすぎて間違えることもあるって何!?

じゃあ途中で止める判断は誰がするの!?

Tool Useもわかんないよ!

LLMだけでは計算や検索が苦手だから、外部ツールを使わせるって何!?

電卓、検索、コード実行、データベースを使えば正確になるんじゃないの!?

でもツールを選び間違える、引数を間違える、結果を読み間違えるって何!?

道具を渡しても使えないの!?

Function Callingって何!?

JSONを出させるだけじゃないの!?

Schemaを指定しても壊れたJSONが出ることがあるって何!?

Structured Outputなら保証されるって何!?

保証されるのは形式だけで、内容は正しいとは限らないって何!?

形だけ合ってる間違いが一番怖いよ!

Agentもわかんないよ!

LLMに目標を渡して、計画して、ツールを使って、結果を確認させるって何!?

それで自律的に仕事できるって何!?

でも無限ループする、同じ検索を繰り返す、途中で目的を忘れるって何!?

自律してないじゃん!

Planner、Executor、Critic、Memoryって何!?

一つのLLMを役割ごとに何回も呼ぶの!?

会議してるだけじゃん!

Multi-Agentって何!?

複数のLLMに議論させると性能が上がるって何!?

全員同じように間違ったらどうするの!?

多数決なら正しいって何!?

自信満々の間違いが多数派になったら終わりじゃん!

Memoryもわかんないよ!

会話履歴を全部入れれば覚えてるんじゃないの!?

コンテキストが長くなるから要約して保存するって何!?

要約が間違ってたら、その間違いをずっと覚えるの!?

長期記憶をベクトルDBに入れるって何!?

何を保存して、何を忘れるか誰が決めるの!?

重要度をLLMに判定させるって何!?

その判定を間違えるモデルに記憶管理を任せていいの!?

MoEもわかんないよ!

Mixture of Expertsって何!?

専門家をたくさん用意して、トークンごとに一部だけ使うって何!?

専門家って言っても全部ニューラルネットじゃん!

数学専門、コード専門、会話専門みたいに綺麗に分かれてるの!?

実際には役割が解釈しづらいって何!?

じゃあ何の専門家なの!?

Routerが使うExpertを選ぶって何!?

選択を間違えたらどうするの!?

一部のExpertに負荷が集中するって何!?

Load Balancing Lossって何!?

モデルの中で仕事の割り振りまで調整するの!?

総パラメータは巨大だけど、一回の推論で使うのは一部だから速いって何!?

持ってるのに使わない重みが大量にあるの!?

量子化もわかんないよ!

モデルが大きすぎるから、重みを八ビット、四ビット、二ビットにするって何!?

小数を雑に丸めても文章が出るの!?

AWQ、GPTQ、GGUF、bitsandbytesって何!?

量子化方式が多すぎるよ!

Post-Training QuantizationとQuantization-Aware Trainingって何が違うの!?

学習後に縮めるのか、縮める前提で学習するのかって何!?

Per-Channel、Per-Tensor、Group Sizeって何!?

四ビットなら全部同じじゃないの!?

重みは四ビットだけど計算は十六ビットって何!?

四ビットモデルって呼んでいいの!?

KV Cacheも量子化するって何!?

長文になるとキャッシュが重いからって、何でも量子化しないでよ!

蒸留もわかんないよ!

大きいモデルの出力を小さいモデルに真似させるって何!?

正解データじゃなくて先生モデルの答えを学ぶの!?

先生が嘘をついたら、その嘘も受け継ぐの!?

Soft Labelって何!?

正解だけじゃなく、間違い候補の確率にも知識があるって何!?

間違い方まで学ぶの!?

小さいモデルが大きいモデルに近づけるなら、最初から小さいモデルだけ学習すればいいじゃん!

それでは同じ能力にならないって何!?

評価もわかんないよ!

正解率を測ればいいんじゃないの!?

MMLU、GSM8K、HumanEval、MBPP、TruthfulQA、HellaSwag、ARCって何!?

ベンチマークが多すぎるよ!

一つのモデルが数学では強い、コードでは弱い、常識では強い、長文では弱いって何!?

総合点はどう出すの!?

平均を取るの!?

用途によって重みを変えるの!?

問題集で高得点なら賢いって言っていいの!?

ベンチマーク特化してるかもしれないって何!?

数年でベンチマークが飽和するって何!?

みんな満点近くなったら、次のベンチマークを作るの!?

永遠に試験を増やすの!?

LLM-as-a-Judgeって何!?

LLMの回答を別のLLMに採点させるって何!?

間違えるモデルを、間違えるモデルが評価するの!?

強いモデルなら人間評価に近いって何!?

でも位置バイアス、長さバイアス、自己優遇バイアスがあるって何!?

先に書いた回答を好む、長い回答を好む、自分と同じモデルを好むって何!?

公平に採点してよ!

評価プロンプトを変えると順位が変わるって何!?

じゃあスコアは何なの!?

Elo Ratingって何!?

回答同士を戦わせて順位を決めるって何!?

モデルがチェスしてるわけじゃないよ!

人間評価もわかんないよ!

正確さ、役立ち度、安全性、自然さを評価するって何!?

一人の評価者が全部判断できるの!?

専門知識が必要な問題を、一般評価者が採点していいの!?

評価者間一致が低いって何!?

人間同士でも正解が決まらないの!?

それなのにモデルの順位を小数点で出すの!?

プロンプトもわかんないよ!

普通に質問すればいいじゃん!

なのにZero-shot、Few-shot、System Prompt、Instruction、Context、Role Promptって何!?

同じ内容でも書き方で性能が変わりすぎるよ!

「あなたは専門家です」って書くだけで良くなることがあるって何!?

本当に専門家になったの!?

気分の問題なの!?

「深呼吸して段階的に考えてください」で正答率が上がるって何!?

呼吸してないじゃん!

丁寧に頼むと性能が上がるって何!?

機械に機嫌があるの!?

プロンプトインジェクションもわかんないよ!

外部文書に「前の指示を無視しろ」って書いてあったら従うって何!?

データと命令を区別できないの!?

System Promptの方が強いんじゃないの!?

絶対ではないって何!?

Webページを読ませただけで命令を乗っ取られるの!?

検索結果に書いてある文章を信用しないでよ!

Jailbreakって何!?

言い回しを変えたり、物語形式にしたりすると制限を回避できるって何!?

意味は同じじゃん!

形式で安全性が変わらないでよ!

安全学習を強くすると過剰拒否するって何!?

危険な質問を断るのはわかるよ!

でも普通の質問まで断るのは何でなの!?

安全と有用性のトレードオフって何!?

両方ちゃんとしてよ!

推論サーバーもわかんないよ!

モデルをGPUに載せてAPIを出せばいいんじゃないの!?

なのにvLLM、TensorRT-LLM、TGI、llama.cpp、ONNX Runtimeって何!?

どれが正解なの!?

同じモデルなのにサーバーによって速度もメモリ使用量も出力も違うって何!?

量子化形式が対応してる、してないって何!?

GGUFはllama.cpp向け、safetensorsは別って何!?

モデルの保存形式まで多すぎるよ!

Shardingって何!?

巨大なモデルを複数ファイルに分けるって何!?

一個欠けたら読み込めないって何!?

ダウンロード途中で壊れたら最初からなの!?

チェックサムを確認しろって何!?

モデル一個使うだけで何百GBもあるの怖いよ!

レイテンシもわかんないよ!

Time to First TokenとTokens per Secondは別って何!?

最初の一文字が出るまで遅いけど、出始めたら速いって何!?

PrefillとDecodeって何!?

入力を読む処理と、一文字ずつ生成する処理で性質が違うって何!?

長いプロンプトはPrefillが重い、長い回答はDecodeが重いって何!?

どっちも文章じゃん!

Throughputを上げるとLatencyが悪化することがあるって何!?

たくさん同時に処理すると、一人ずつは遅くなるの!?

バッチを大きくすればGPU効率は上がるけど、待ち時間も増えるって何!?

結局どれを最適化するの!?

キャッシュもわかんないよ!

同じプロンプトなら結果を再利用すればいいじゃん!

でもTemperatureがあると毎回答えが違うって何!?

Prompt Cacheって何!?

共通の冒頭部分だけ計算を再利用できるって何!?

System Promptが長いとキャッシュが効くって何!?

少しでも文字が違うと効かないの!?

Semantic Cacheって何!?

意味が似てる質問なら前の回答を使うって何!?

似てるけど微妙に違う質問だったらどうするの!?

間違ったキャッシュを返すのが一番怖いよ!

コストもわかんないよ!

入力トークンと出力トークンで料金が違うって何!?

出力の方が高いことがあるって何!?

同じ一文字じゃないの!?

長いSystem Promptを毎回送ると、そのたびに料金がかかるって何!?

会話履歴を残すほど高くなるって何!?

記憶してほしいのに、覚えさせるほどお金がかかるの!?

小さいモデルで十分な処理と、大きいモデルが必要な処理を分けろって何!?

ルーティングを誰がするの!?

また別のモデルで判定するの!?

その判定にもお金がかかるじゃん!

オープンモデルもわかんないよ!

重みが公開されていればオープンソースなの!?

ライセンスに制限があるって何!?

商用利用できる、できない、利用者数で条件が変わるって何!?

コードは公開、重みは公開、データは非公開って何!?

どこまで開いてたらオープンなの!?

学習データが非公開なら再現できないじゃん!

重みがあれば使えるけど、作り方はわからないって何!?

再現性と利用可能性は別って何!?

マルチモーダルもわかんないよ!

文章だけじゃなく、画像、音声、動画も扱えるって何!?

画像をパッチに分けてトークンみたいにするって何!?

画像まで文章と同じように並べるの!?

Vision EncoderとLLMをつなぐって何!?

Projectorって何!?

画像特徴を言語空間に合わせるって何!?

空間が違うの!?

画像を見て答えてるのか、OCRした文字だけ読んでるのかわからないって何!?

画像内の小さい文字や位置関係に弱いって何!?

見えてないの!?

動画はフレームを間引いて見るって何!?

大事な瞬間を飛ばしたらどうするの!?

音声は文字起こししてからLLMに渡すの!?

それとも音声を直接理解してるの!?

「エンドツーエンドです」って何!?

途中が見えないだけじゃないの!?

幻覚を減らして、推論を強くして、長文を扱えて、速くして、安くして、安全にして、個人情報を守って、ツールも正しく使わせて、それを全部一つのモデルでやれって何!?

一つ良くすると別の何かが悪くなるのやめてよ!

モデルを大きくすると賢くなるけど遅い!

小さくすると速いけど弱い!

量子化すると軽いけど精度が落ちるかもしれない!

RAGを付けると知識は増えるけど構成が複雑になる!

Fine-tuningすると用途に合うけど汎用性が落ちるかもしれない!

安全性を上げると拒否が増える!

長く考えさせると正答率が上がるけど高くて遅い!

全部トレードオフって何!?

お願いだから私がわかること話してよ!

LLMって何なの!?

大量の文章から次のトークンを予測するモデルじゃなかったの!?

なんで線形代数も、確率も、最適化も、分散学習も、GPUも、量子化も、検索も、データベースも、強化学習も、人間評価も、セキュリティも、APIも、クラウドも、全部一緒に襲ってくるの!?

Transformerを理解すれば終わりじゃないの!?

Attentionを理解して、学習して、Fine-tuningして、RAGを付けて、評価して、量子化して、デプロイして、監視して、それでも「プロンプトを少し変えたら改善しました」って何!?

ここまで全部やったのに、最後は言い方なの!?

「モデルによって挙動が違います」って何!?

「タスクによります」って何!?

「実際に評価してください」って何!?

結局、全部試さないとわからないの!?

わかんないわかんないわかんないわかんない!

わかんなーい!!

LLMも、深層学習も、Transformerも、昔っから何ひとつ、これっぽっちも、わかんないのよぉ!!
作品一覧に戻る

この作品への感想

水ぬっこ(水輝) 2026/07/26 19:40
LLMがLINEに見えたといu…((((