准大二学生从0开始学AI——机器学习Day23
---type: daily_notetitle: 大目录推荐 强化学习入门date: 2026-08-15person: 吴恩达phase: 2.3topics:[大目录推荐,检索排序两步,推荐系统道德使用,强化学习入门,状态动作奖励,Return折扣,]---# 2026-08-15 学习笔记## 笔记区### 核心观点- **#123 从大目录中推荐**真实产品几百万个商品不能对每个商品一步到位算相似度/打分太慢。拆成两步——**检索**用轻量办法快筛出几百个候选覆盖面广不怕混入不喜欢的**排序**对这几百个候选用学到的模型精确打分、按分展示。一步求快、一步求准。- **#124 推荐系统的道德使用**优化目标只看短期点击/停留算法会学会推荐抓住眼球的极端/不良内容形成上瘾循环。用户好奇点一下会被误判成喜欢越推越多**正反馈放大**。还有公平性对不同人群推荐质量不一和不透明用户不知道为什么看到这些。- **#125 基于内容过滤的 TensorFlow 实现**两个网络——用户属性过用户网络变用户画像向量 v_u电影属性过物品网络变电影画像向量 v_m都是**训练时学出来的**不是人工写死最后点积看合不合拍。和 #122 骨架一致。- **#126 什么是强化学习**和监督学习的本质区别——监督学习给输入-标准答案对照着学强化学习**不给标准答案**智能体在环境里试错靠每次行动拿到的奖励信号正/负自己摸索怎么做最好。- **#127 火星探测器示例**位置**状态**在哪格可做的选择**动作**往左/往右走到某格拿到的分**奖励**。- **#128 The Return****回报** 从某一步开始把将来所有奖励加起来的总账衡量一条路/一种策略有多好。越远的奖励要**打折**乘 γ1如 0.9/0.99因为**现在的奖励比以后的更值钱**时间价值。折扣让机器偏好尽快拿奖励。### 关键方法/流程**大目录推荐两步#123**检索从几百万快筛出几百个候选找相似/按类型补不怕混入不喜欢的排序对候选精确打分从高到低展示权衡检索越多越准但越慢用离线实验试 100 还是 500**Return 折扣#128**Return R₁ γR₂ γ²R₃ γ³R₄ ...γ 略小于 10.9 / 0.99 / 0.999越远的奖励折扣越多直觉脚下 5 块 vs 半小时后 10 块正常人拿 5 块**RL 三件套#126-#127**状态 state 我在哪火星车在第几格动作 action 我能做什么往左/往右奖励 reward 做完这步拿到的分走到那格的分### 实战记录- #123 淘宝猜你喜欢理解两步推荐- #124 抓住好奇点一下→误判喜欢→越推越多的正反馈放大机制- #126 用教育类比 RL搞得好我就表扬搞得不好我就骂监督学习给标签相当于把标准答案都给你了- #128 急功近利——折扣让机器偏好尽快拿奖励- 感觉强化学习很简单跟教育有关搞得好我就表扬搞得不好我就骂---## 线索区学完后合上材料自问自答**Q: 为什么推荐不能一步到位要拆成检索排序**A: 几百万商品挨个算打分太慢。先检索快筛几百个候选再排序精确排先后。**Q: 推荐系统只顾短期点击会带来什么问题**A: 学会推荐抓住眼球的极端/不良内容好奇点击被误判成喜欢正反馈放大。你点了系统以为你喜欢往后经常给你推荐……软件全是问题。**Q: 内容过滤实现里两个向量是怎么来的**A: 用户网络提炼 v_u、物品网络提炼 v_m都是训练时学出来的不是写死的点积算匹配。**Q: 强化学习和监督学习最本质的区别**A: 监督学习有标准答案照着学强化学习不给答案靠奖励试错。监督学习给标签把标准答案都给你了而强化学习是赏罚分明没标准答案。**Q: 火星车例子里状态/动作/奖励分别是什么**A: 状态在哪格动作往左/往右奖励走到那格的分。**Q: Return 是什么为什么越远的奖励要打折**A: 把奖励加起来的总账衡量策略好坏。越远越打折是因为现在的钱比以后的更值钱让智能体偏好尽快拿奖励。急功近利。---## 总结50字以内大目录推荐用检索排序两步把推荐系统搬进几百万商品的产品强化学习登场——不给标准答案、靠奖励试错状态/动作/奖励三件套 Return 打折算总账。---## 复习卡片| 概念 | 一句话 | 我的场景 || -------------- | ---------------------------- | --------------------------- || 检索排序 | 先快筛几百候选再精确排序 | 淘宝猜你喜欢 || 道德使用 | 只看短期点击会放大不良内容 | 好奇点一下→越推越多 || 内容过滤实现 | 两个网络学出向量点积看合拍 | v_u × v_m || RL vs 监督 | 不给标准答案靠奖励试错 | 教育奖惩 || 状态/动作/奖励 | 在哪格 / 能做什么 / 拿到的分 | 火星车 || Return | 奖励加总、越远越打折 | 脚下 5 块 vs 半小时后 10 块 |