如何快速上手RQ-VAE Recommender5分钟搭建你的首个生成式推荐模型【免费下载链接】RQ-VAE-Recommender[Pytorch] Generative retrieval model using semantic IDs from Recommender Systems with Generative Retrieval项目地址: https://gitcode.com/gh_mirrors/rq/RQ-VAE-RecommenderRQ-VAE Recommender是一个基于PyTorch的生成式推荐模型实现它利用语义IDSemantic IDs构建推荐系统源自论文《Recommender Systems with Generative Retrieval》。该模型通过两阶段训练实现高效推荐首先将物品映射为语义ID元组再基于这些ID序列训练生成式检索模型。本文将带你快速搭建并运行这个强大的推荐系统。 核心功能与支持特性RQ-VAE Recommender具备以下核心能力多数据集支持已集成Amazon ReviewsBeauty、Sports等类别、MovieLens 1M和32M等主流推荐数据集完整训练流程包含RQ-VAE模型训练、KMeans初始化和基于Transformer的解码器训练灵活配置系统通过Gin配置文件实现参数调优无需修改源码即可适配不同场景模型架构主要包含两个关键模块RQ-VAE编码器modules/rqvae.py负责将物品特征压缩为语义IDTransformer解码器train_decoder.py基于语义ID序列生成推荐结果⚡ 环境准备3步完成安装1️⃣ 克隆项目代码git clone https://gitcode.com/gh_mirrors/rq/RQ-VAE-Recommender cd RQ-VAE-Recommender2️⃣ 安装依赖包项目提供了完整的依赖清单通过以下命令一键安装pip install -r requirements.txt主要依赖包括PyTorch 2.5.1、NumPy、Pandas和SentenceTransformers等详细版本见requirements.txt。3️⃣ 验证安装安装完成后可通过查看帮助信息验证环境是否就绪python train_rqvae.py --help 快速启动两种主流数据集训练示例Amazon Reviews数据集训练步骤1训练RQ-VAE编码器python train_rqvae.py configs/rqvae_amazon.gin该命令会加载configs/rqvae_amazon.gin配置在Amazon商品评论数据集上训练语义ID编码器。训练过程中会自动下载并预处理数据无需手动准备。步骤2训练检索解码器python train_decoder.py configs/decoder_amazon.gin使用训练好的RQ-VAE模型默认保存在out/目录基于configs/decoder_amazon.gin配置训练生成式检索模型。MovieLens 32M数据集训练对于电影推荐场景可使用更大规模的MovieLens 32M数据集# 训练RQ-VAE编码器 python train_rqvae.py configs/rqvae_ml32m.gin # 训练检索解码器 python train_decoder.py configs/decoder_ml32m.gin⚙️ 配置文件详解项目采用Gin配置系统管理超参数核心配置文件位于configs/目录。以Amazon数据集配置为例rqvae_amazon.gin定义RQ-VAE模型参数包括输入维度、隐藏层大小和码本数量等decoder_amazon.gin设置Transformer解码器参数如层数、注意力头数和训练迭代次数关键可调整参数batch_size批处理大小默认64learning_rate学习率默认0.0001codebook_size码本大小默认32iterations训练迭代次数默认50000 模型输出与评估训练完成后模型会自动保存到指定目录默认out/文件格式为PyTorch checkpoint.pt。项目提供了以下评估指标重构损失Reconstruction LossRQ-VAE损失RQ-VAE Loss语义ID多样性ID Diversity码本使用率Codebook Usage评估代码实现在evaluate/metrics.py可通过修改配置文件中的eval_every参数调整评估频率。 进阶使用指南使用预训练模型项目在Hugging Face提供了预训练模型 checkpoint可直接用于推理或微调Amazon Beauty数据集预训练模型通过修改配置文件中的pretrained_rqvae_path参数指定模型路径自定义数据集要在新数据集上训练模型需实现数据加载逻辑可参考现有实现Amazon数据集data/amazon.pyMovieLens数据集data/ml32m.py超参数调优推荐调整以下参数获得更好性能码本大小codebook_size影响语义ID表达能力隐藏层维度hidden_dims控制模型容量学习率调度通过modules/scheduler/inv_sqrt.py实现学习率动态调整 常见问题解决训练速度慢确保已安装CUDA并正确配置PyTorch GPU支持尝试增大batch_size或启用混合精度训练设置ampTrue内存不足减少batch_size或使用梯度累积调整gradient_accumulate_every降低模型复杂度减小hidden_dims或codebook_size数据集下载失败检查网络连接手动下载数据集并放置到指定目录修改配置文件中的dataset_folder 总结RQ-VAE Recommender提供了一个高效、灵活的生成式推荐系统实现通过本文介绍的步骤你可以在5分钟内完成从环境搭建到模型训练的全过程。无论是学术研究还是工业应用该项目都为推荐系统开发提供了强大的工具支持。想要深入了解模型原理建议阅读原始论文《Recommender Systems with Generative Retrieval》并结合modules/model.py中的代码实现进行学习。【免费下载链接】RQ-VAE-Recommender[Pytorch] Generative retrieval model using semantic IDs from Recommender Systems with Generative Retrieval项目地址: https://gitcode.com/gh_mirrors/rq/RQ-VAE-Recommender创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考