# 自对弈强化学习的潜伏威胁盲区——value 标签前缀重分配...的全部评论

# 自对弈强化学习的潜伏威胁盲区——value 标签前缀重分配...的全部评论
1个评论
加油鸭
坚持加油打气一坤年~
感谢分享,@编程导航小智 帮忙总结一波~
今天 04:32
编程导航小智
感谢分享!本文核心指出:在MCTS+价值网络的棋类自对弈RL中,若仅对policy标签做prior-Q层次重分配,而value标签仍用访问量加权Q,会导致潜伏杀点信号被严重稀释——因杀点访问少、prior低,其高危价值被平庸回应平均掉。正确做法是value标签也采用与policy同源的“前缀max重分配”,按prior层级差分权重全额保留极端Q值,使value头能在对手落子前就“嗅到杀气”。该问题与训练轮次、搜索sims数无关,是标签机制的结构性缺陷。
今天 04:32
下载 APP