前言Milvus作为使用最广泛的向量数据库之一在市场中占据了很大的份额我们想要学习大模型RAG向量数据库是逃不开的一环根据上一篇文章我们已经配置好了milvus接下来我们来学习一下如何向Milvus中批量导入数据。一、准备工作1、准备环境博主用的是linux中的ubuntu系统此处推荐使用linux系统进行操作2、下载embedding模型我们在modelscope社区下载对应模型首先安装modelscope包方便下载pipinstallmodelscope下载到当前文件夹此处下载的是bge模型如需其他模型请自行更改mkdirbge-m3 modelscope download--modelBAAI/bge-m3--local_dir./dir等待下载完成即可二、主要代码讲解1、连接数据库首先连接服务器创建databaseclientMilvusClient(urihttp://xx.xx.xx.xx:19530,tokenroot:Milvus#此处使用token登录方式默认用户名密码)client.create_database(db_nametests_db)#此命令只在第一次运行添加后续运行注释掉client.use_database(db_nametests_db)#使用该database进行后续操作2、创建集合#schema 参数编写 定义表结构schemaMilvusClient.create_schema(auto_idFalse)schema.add_field(field_nameid,datatypeDataType.INT64,is_primaryTrue)#IDschema.add_field(field_namevector,datatypeDataType.FLOAT_VECTOR,dim1024)#存入内容展示schema.add_field(field_namecontent,datatypeDataType.VARCHAR,max_length65535)#内容转换成的向量结果展示ifclient.has_collection(collection_namedemo_collection): client.drop_collection(collection_namedemo_collection)#根据编写的schema进行集合创建 只第一次使用后续再运行将会进行覆盖操作client.create_collection(collection_namedemo_collection,schemaschema)3、embedding模型引入bge_m3_efBGEM3EmbeddingFunction(model_name/data/models/embedding/bge-m3/,#此处为本地模型地址也可使用BAAI/bge-m3地址格式会在huggingface上下载devicecpu,#CPU或者cuda:0use_fp16False)4、数据准备docs[无边落木萧萧下不尽长江滚滚来。,在天愿作比翼鸟在地愿为连理枝。,千山鸟飞绝万径人踪灭。,]docs_embeddingsbge_m3_ef.encode_documents(docs)#将上述文本向量化处理time_numberdatetime.now().strftime(%Y%m%d%H%M%S)#id编写#按照集合创建格式进行内容对齐data[{id:int(str(time_number)str(i)),vector:docs_embeddings[dense][i],content:docs[i]}foriinrange(len(docs_embeddings[dense]))]5、批量导入数据# 创建向量索引 只需在第一次集合创建时使用给新的集合创建向量索引index_paramsMilvusClient.prepare_index_params()index_params.add_index(field_namevector,index_typeHNSW,metric_typeL2,params{M:16,efConstruction:200})client.create_index(collection_namedemo_collection,index_paramsindex_params)# 插入数据client.insert(collection_namedemo_collection,datadata)# 加载集合到内存需在创建索引后执行client.load_collection(collection_namedemo_collection)完成之后即可在Attu中查看到导入的数据三、完整代码复制 填写空白参数即可运行from pymilvusimportMilvusClient, DataType from pymilvus.model.hybridimportBGEM3EmbeddingFunction from datetimeimportdatetime clientMilvusClient(uri,# http://xx.xx.xx.xx:19530token# root:Milvus)client.create_database(db_nametests_db)client.use_database(db_nametests_db)schemaMilvusClient.create_schema(auto_idFalse)schema.add_field(field_nameid,datatypeDataType.INT64,is_primaryTrue)schema.add_field(field_namevector,datatypeDataType.FLOAT_VECTOR,dim1024)schema.add_field(field_namecontent,datatypeDataType.VARCHAR,max_length65535)ifclient.has_collection(collection_namedemo_collection): client.drop_collection(collection_namedemo_collection)client.create_collection(collection_name,#demo_collectionschemaschema)bge_m3_efBGEM3EmbeddingFunction(model_name,#本地bge-m3 Embedding模型绝对路径devicecpu,use_fp16False)docs[无边落木萧萧下不尽长江滚滚来。,在天愿作比翼鸟在地愿为连理枝。,千山鸟飞绝万径人踪灭。,]docs_embeddingsbge_m3_ef.encode_documents(docs)time_numberdatetime.now().strftime(%Y%m%d%H%M%S)data[{id:int(str(time_number)str(i)),vector:docs_embeddings[dense][i],content:docs[i]}foriinrange(len(docs_embeddings[dense]))]# 创建向量索引index_paramsMilvusClient.prepare_index_params()index_params.add_index(field_namevector,index_typeHNSW,metric_typeL2,params{M:16,efConstruction:200})client.create_index(collection_namedemo_collection,index_paramsindex_params)# 插入数据client.insert(collection_namedemo_collection,datadata)# 加载集合到内存需在创建索引后执行client.load_collection(collection_namedemo_collection)结语运行上述代码后即可成功实现批量导入数据到milvus向量数据库。如果在运行中遇到问题可以在评论区留言我看到会积极回复后续我还会出更多关于dify与大模型相关的实用教程记得关注我我们下次再见