TangShusen

  • 首页

  • 标签

  • 分类

  • 归档

  • 关于

  • 内推

LLM中的位置编码

发表于 2026-09-06 | 分类于 LLM | 评论数: | 阅读次数:

Transformer中的注意力计算是与位置无关的,这显然与真实语言逻辑不符。因此,我们需要引入位置编码(Position Encoding, PE)来告诉模型每个 token 在序列中的位置。本文介绍了三种常见的位置编码:训练式位置编码、正余弦位置编码以及现代LLM常用的RoPE位置编码。

阅读全文 »

LLM场景下的强化学习——PPO、DPO、GRPO

发表于 2026-08-30 | 更新于 2026-09-06 | 分类于 RL | 评论数: | 阅读次数:

在LLM训练场景中,一般在监督微调(SFT)阶段之后,需要通过强化学习对模型进一步优化,让模型生成符合人类偏好的内容。

阅读全文 »

强化学习基础与经典算法

发表于 2026-06-21 | 分类于 RL | 评论数: | 阅读次数:

强化学习入门,包括基本思想、经典算法(如Q-Learning,DQN,Policy Gradient、Actor-Critic等)。

阅读全文 »

LLM 之 GPT 系列(GPT、GPT2、GPT3、InstructGPT)

发表于 2026-06-07 | 分类于 LLM | 评论数: | 阅读次数:


本文从初代 GPT 开始,总结 GPT 系列(GPT、GPT2、GPT3、InstructGPT/ChatGPT)的发展演变,主要包括模型结构、训练数据、核心创新等。

阅读全文 »
12…5
TangShusen

TangShusen

19 日志
9 分类
30 标签
RSS
GitHub 知乎
我的项目
  • LeetCode题解
  • 《动手学深度学习》(PyTorch版)
  • 《Deep Learning with PyTorch》中文翻译
© 2018 – 2026 TangShusen tip:本博客在电脑端食用更佳~
total view times: