想问下MIND里 这段代码为什么不需要加上axis=1呢?不是胶囊维度的softmax得到权重吗? `weight = tf.nn.softmax(routing_logits_with_padding)` 然后召回阶段是学习表征,目前主流方案都是像word2vec一样负采样用triplet loss来学习 ,为什么代码里都是sampled_softmax_loss这种方式呢?学习表征的话负采样已经被验证和sampled_softmax_loss相比不影响最终效果
想问下MIND里 这段代码为什么不需要加上axis=1呢?不是胶囊维度的softmax得到权重吗?
weight = tf.nn.softmax(routing_logits_with_padding)然后召回阶段是学习表征,目前主流方案都是像word2vec一样负采样用triplet loss来学习 ,为什么代码里都是sampled_softmax_loss这种方式呢?学习表征的话负采样已经被验证和sampled_softmax_loss相比不影响最终效果