← cd ~/tags

Tag

#大模型

2 篇笔记

5 MIN

KV Cache:为什么长上下文又慢又贵

从注意力公式出发,算一笔显存账:KV Cache 是什么、为什么它决定了推理成本,以及写 prompt 时怎么蹭上缓存。

  • #AI
  • #大模型
6 MIN

大模型是怎么"说话"的:从 token 到下一个词

拆开一次对话的全过程:分词、向量、Transformer、采样,以及这套机制为什么会导致幻觉和数不清字母。

  • #AI
  • #大模型

↑↓ 选择↵ 打开