首页/新闻资讯/正文详情

Apache PredictionIO Docker 部署指南:用 docker-compose 可插拔存储启动事件服务器、训练与部署推荐引擎

发布时间:2026/9/23 8:00:27 来源:云帆数科 栏目:资讯中心
Apache PredictionIO Docker 部署指南:用 docker-compose 可插拔存储启动事件服务器、训练与部署推荐引擎
Apache PredictionIO Docker 部署指南用 docker-compose 可插拔存储启动事件服务器、训练与部署推荐引擎【免费下载链接】predictionioPredictionIO, a machine learning server for developers and ML engineers.项目地址: https://gitcode.com/gh_mirrors/pred/predictionio本篇技术指南围绕 docker/README.md 展开完整讲解如何通过 Docker 与 docker-compose 快速拉起 Apache PredictionIO 的完整运行环境包括按需选择 Event / Meta / Model 三类存储后端PostgreSQL、MySQL、Elasticsearch、LocalFS、使用pio-docker封装命令完成注册应用 → 导入数据 → 构建模板 → 训练 → 部署 → 在线查询的推荐引擎全流程并覆盖 Spark 集群训练、Engine Server 独立部署、Jupyter 交互式分析等进阶场景。读完本文你将能够在开发或生产环境中用一套可复用的 docker-compose 组合文件启动 PredictionIO 事件服务器并完成一个可查询推荐结果的端到端演示。一、PredictionIO Docker 概览Apache PredictionIO 是一个面向开发者和 ML 工程师的机器学习服务器其典型的 DASEDataSource、Algorithm、Serving、Evaluator架构由多个组件协作Event Server收集用户行为事件、训练引擎Spark 驱动、Engine Server对外提供查询接口以及存放 metadata / event data / model data 三类数据的存储后端。Docker 化部署把这些组件封装进镜像使开发与生产环境保持一致。仓库中的 docker 目录提供了基础pio镜像定义docker/pio/Dockerfile一系列可组合的 docker-compose 文件用于按需选择存储后端用于在容器内执行pio命令的入口脚本docker/pio/pio_runJupyter 镜像与 docker/JUPYTER.md 文档Kubernetes Helm Chartdocker/charts。与直接在宿主机安装 PredictionIO 相比Docker 方案的核心优势在于存储后端以可插拔方式通过 docker-compose 叠加文件选择无需手工修改pio-env.sh即可切换 PostgreSQL / MySQL / Elasticsearch / LocalFS 等组合。二、核心概念用可选择的 docker-compose 文件决定存储后端PredictionIO 有三类数据仓库分别由环境变量PIO_STORAGE_REPOSITORIES_*指定仓库环境变量前缀用途MetaPIO_STORAGE_REPOSITORIES_METADATA_*存储引擎元数据引擎注册、参数变体等EventPIO_STORAGE_REPOSITORIES_EVENTDATA_*存储事件数据用户行为、属性等供 Event Server 读写ModelPIO_STORAGE_REPOSITORIES_MODELDATA_*存储训练产生的模型docker-compose 目录按存储类型分目录组织每个目录内又按仓库用途拆分为base、meta、event、model四个叠加文件。支持的存储后端组合如下对应 docker/README.md 中的表格类型可选存储EventPostgreSQL、MySQL、ElasticsearchMetaPostgreSQL、MySQL、ElasticsearchModelPostgreSQL、MySQL、LocalFS由于 docker-compose 支持-f指定多个文件并按顺序叠加后加载的键覆盖先加载的键所以可以通过基础文件 任意存储组合的方式启动环境docker-compose -f docker-compose.yml -f ... up2.1 基础文件docker-compose.ymldocker/docker-compose.yml 定义核心pio服务version: 3 services: pio: image: predictionio/pio:latest ports: - 7070:7070 - 8000:8000 volumes: - ./templates:/templates dns: 8.8.8.8要点端口映射7070是 Event Server 端口接收事件写入8000是 Engine Server 查询端口/queries.json卷挂载宿主机./templates目录挂载到容器内/templates模板工程放在宿主机该目录下即可在容器内访问dns: 8.8.8.8用于保证容器内能解析外部域名下载依赖、拉取数据等。2.2 存储后端叠加文件剖析以 PostgreSQL 为例需要叠加 4 个文件docker-compose -f docker-compose.yml \ -f pgsql/docker-compose.base.yml \ -f pgsql/docker-compose.meta.yml \ -f pgsql/docker-compose.event.yml \ -f pgsql/docker-compose.model.yml \ updocker/pgsql/docker-compose.base.yml 启动postgres:9数据库服务用户/密码均为pio--encodingUTF8并通过depends_on保证数据库先就绪同时注入 JDBC 数据源配置environment: PIO_STORAGE_SOURCES_PGSQL_TYPE: jdbc PIO_STORAGE_SOURCES_PGSQL_URL: jdbc:postgresql://postgres/pio PIO_STORAGE_SOURCES_PGSQL_USERNAME: pio PIO_STORAGE_SOURCES_PGSQL_PASSWORD: piodocker/pgsql/docker-compose.meta.yml、docker/pgsql/docker-compose.event.yml、docker/pgsql/docker-compose.model.yml 分别把三个仓库指向PGSQL数据源并命名environment: PIO_STORAGE_REPOSITORIES_METADATA_NAME: pio_meta PIO_STORAGE_REPOSITORIES_METADATA_SOURCE: PGSQL其他后端同理MySQLdocker/mysql/docker-compose.base.yml 使用mysql:8PIO_STORAGE_SOURCES_MYSQL_TYPE: jdbc、PIO_STORAGE_SOURCES_MYSQL_URL: jdbc:mysql://mysql/piometa/event/model 三个文件把仓库指向MYSQLElasticsearchdocker/elasticsearch/docker-compose.base.yml 使用elasticsearch:5.6.4关闭 xpack 各组件security/ml/monitoring/watcher/graph设置cluster.namepredictionio、ES_JAVA_OPTS-Xms1g -Xmx1g并注入PIO_STORAGE_SOURCES_ELASTICSEARCH_HOSTS: elasticsearch、PORTS: 9200、SCHEMES: httpLocalFS仅 Modeldocker/localfs/docker-compose.model.yml 使用本地文件系统存放模型environment: PIO_STORAGE_REPOSITORIES_MODELDATA_NAME: pio_model PIO_STORAGE_REPOSITORIES_MODELDATA_SOURCE: LOCALFS PIO_FS_BASEDIR: /work/pio_store PIO_FS_ENGINESDIR: /work/pio_store/engines PIO_FS_TMPDIR: /work/pio_store/tmp PIO_STORAGE_SOURCES_LOCALFS_TYPE: localfs PIO_STORAGE_SOURCES_LOCALFS_PATH: /work/pio_store/models这些PIO_STORAGE_SOURCES_*/PIO_STORAGE_REPOSITORIES_*/PIO_FS_*环境变量与pio-env.sh中的配置一一对应容器启动时会被加载为 PredictionIO 的存储配置。注意叠加文件之间是仓库用途的解耦例如 Model 完全可以换成 LocalFS 而保持 Meta/Event 用 PostgreSQL。三、实战教程用 Docker 构建一个推荐引擎下面完整复现 docker/README.md 的推荐模板演示流程。3.1 启动 PredictionIO 环境以 PostgreSQL 作为三类存储启动环境$ docker-compose -f docker-compose.yml \ -f pgsql/docker-compose.base.yml \ -f pgsql/docker-compose.meta.yml \ -f pgsql/docker-compose.event.yml \ -f pgsql/docker-compose.model.yml \ up容器启动后docker/pio/pio_run 入口脚本会依次执行若配置了 Elasticsearch 数据源则循环等待 ES 集群健康状态变为 green最多重试 10 次若配置了 MySQL 数据源则检查$PIO_HOME/lib/mysql-connector-java-$MYSQL_VERSION.jar是否存在不存在则自动下载循环执行pio status等待 PredictionIO 就绪最后默认启动 Event Serverpio eventserver除非设置了PIO_RUN_FILE见下文 Engine Server 一节。3.2 使用 pio-docker 封装命令仓库为pio命令提供了容器内的封装pio-docker它在 PredictionIO 容器内执行对应的pio子命令使你不必手动docker exec。将仓库根目录的bin加入 PATH 后即可使用$ export PATHpwd/bin:$PATH $ pio-docker status ... [INFO] [Management$] Your system is all ready to go.3.3 下载推荐模板本演示使用 Apache PredictionIO 的推荐模板recommender template。进入挂载目录并克隆模板$ cd templates $ git clone https://github.com/apache/predictionio-template-recommender.git MyRecommendation $ cd MyRecommendation由于./templates已挂载进容器/templates模板源码在容器内可见。3.4 注册应用Application每个引擎对应一个 Application需要先在 PredictionIO 中注册以获取 Access Key$ pio-docker app new MyApp1 [INFO] [App$] Initialized Event Store for this app ID: 1. [INFO] [Pio$] Created a new app: [INFO] [Pio$] Name: MyApp1 [INFO] [Pio$] ID: 1 [INFO] [Pio$] Access Key: i-zc4EleEM577EJhx3CzQhZZ0NnjBKKdSbp3MiR5JDb2zdTKKzH9nF6KLqjlMnvlAccess Key 是后续导入数据、写事件的凭证先保存到环境变量$ ACCESS_KEYi-zc4EleEM577EJhx3CzQhZZ0NnjBKKdSbp3MiR5JDb2zdTKKzH9nF6KLqjlMnvl同时模板的engine.json中datasource.params.appName默认是占位符INVALID_APP_NAME必须改成MyApp1datasource: { params : { appName: MyApp1 } }3.5 导入训练数据模板提供了 Python 导入脚本它依赖 PredictionIO Python SDK$ pip install predictionio下载 MovieLens 样例数据并导入事件服务器$ curl https://raw.githubusercontent.com/apache/spark/master/data/mllib/sample_movielens_data.txt --create-dirs -o data/sample_movielens_data.txt $ python data/import_eventserver.py --access_key $ACCESS_KEY该脚本通过 SDK 把rate等事件写入运行在7070端口的 Event Server。事件数据会落到你在第 2 节选择的 Event 存储中。3.6 构建模板推荐模板是 Scala 工程需要由pio build编译打包$ pio-docker build --verbose构建产物与依赖Spark、Elasticsearch 等都由容器内预装的环境提供详见 docker/pio/Dockerfile。3.7 训练并生成模型执行训练子命令$ pio-docker train训练由 Spark 驱动默认使用容器内嵌的 Spark 本地模式若叠加了 Spark 集群文件见第 4.2 节训练完成后模型写入 Model 存储如 PostgreSQL 或 LocalFS 的/work/pio_store/models。3.8 部署并查询推荐结果模型训练成功后部署到 Prediction Server$ pio-docker deploy部署成功后Engine Server 在8000端口对外提供查询接口。发送一个推荐请求$ curl -H Content-Type: application/json \ -d { user: 1, num: 4 } http://localhost:8000/queries.json返回的 JSON 即为该用户 Top-4 推荐项列表。至此一个完整的数据收集 → 训练 → 服务闭环已在 Docker 环境中跑通。四、进阶主题4.1 使用 Elasticsearch 作为 Meta / Event 存储Elasticsearch 可作 Meta 与 Event 存储Model 存储没有 ES 支持示例中改用 LocalFSdocker-compose -f docker-compose.yml \ -f elasticsearch/docker-compose.base.yml \ -f elasticsearch/docker-compose.meta.yml \ -f elasticsearch/docker-compose.event.yml \ -f localfs/docker-compose.model.yml \ up4.2 使用 Spark 集群训练在基础组合之外追加 docker/docker-compose.spark.yml即可拉起独立的 Spark Master 与 Workerdocker-compose -f docker-compose.yml \ -f docker-compose.spark.yml \ -f elasticsearch/docker-compose.base.yml \ -f elasticsearch/docker-compose.meta.yml \ -f elasticsearch/docker-compose.event.yml \ -f localfs/docker-compose.model.yml \ up该文件使用bde2020/spark-master:2.2.2-hadoop2.7与bde2020/spark-worker:2.2.2-hadoop2.7镜像Master 暴露8080Web UI与7077Spark 通信端口Worker 通过SPARK_MASTERspark://spark-master:7077注册。将训练任务提交到集群时通过--master指定 Spark 集群地址注意pio train自身参数用--分隔pio-docker train -- --master spark://spark-master:7077如需调整集群配置直接修改 docker/docker-compose.spark.yml例如增加 Worker 数量、调整端口。4.3 独立部署 Engine Serverpio-docker deploy是在容器内手动部署如果希望容器启动即自动部署指定引擎可追加 docker/docker-compose.deploy.ymldocker-compose -f docker-compose.yml \ -f pgsql/docker-compose.base.yml \ -f pgsql/docker-compose.meta.yml \ -f pgsql/docker-compose.event.yml \ -f pgsql/docker-compose.model.yml \ -f docker-compose.deploy.yml \ up该文件设置environment: - PIO_TEMPLATE_NAMEMyRecommendation - PIO_RUN_FILE/deploy/run.sh volumes: - ./deploy:/deployPIO_RUN_FILE会改变容器入口行为pio_run检测到该变量后不再启动 Event Server而是执行 docker/deploy/run.shcd /templates/$PIO_TEMPLATE_NAME pio deploy即进入模板目录并执行pio deploy把引擎常驻部署为服务。修改部署行为时可调整PIO_TEMPLATE_NAME与deploy/run.sh。4.4 与 Jupyter 结合做探索性数据分析EDA追加 docker/docker-compose.jupyter.yml 可启动带 Jupyter Notebook 的环境docker-compose -f docker-compose.jupyter.yml \ -f pgsql/docker-compose.base.yml \ -f pgsql/docker-compose.meta.yml \ -f pgsql/docker-compose.event.yml \ -f pgsql/docker-compose.model.yml \ up该文件使用predictionio/pio-jupyter:latest镜像额外映射8888端口并把./templates挂载到/home/jovyan/templates。启动后在浏览器打开http://127.0.0.1:8888/从New下拉菜单打开终端即可在 PredictionIO 环境内执行pio命令进行探索性数据分析EDA。更完整的说明含 Scala 模板与 Python 模板两套入门流程、pio train --main-py-file train.py等用法见 docker/JUPYTER.md。五、开发与发布构建、打标签与推送镜像5.1 构建基础镜像基础镜像定义在 docker/pio/Dockerfile其构建逻辑值得注意基础镜像为openjdk:8内置版本Scala2.11.12、Spark2.2.3、Hadoop2.7.7、Elasticsearch5.5.3、PostgreSQL JDBC42.2.4、MySQL JDBC8.0.12从源码仓库 checkoutv0.13.0标签执行make-distribution.sh -Dscala.version... -Dspark.version... -Dhadoop.version... -Delasticsearch.version... --with-deb构建 deb 包并安装到/usr/share/predictionio即PIO_HOME初始化/etc/predictionio/pio-env.sh写入POSTGRES_JDBC_DRIVER、MYSQL_JDBC_DRIVER、SPARK_HOME等变量EXPOSE 7070 8000默认CMD [sh, /usr/bin/pio_run]。构建命令docker build -t predictionio/pio pio5.2 构建 Jupyter 镜像docker build -t predictionio/pio-jupyter jupyter5.3 推送镜像发布流程docker push predictionio/pio:latest docker tag predictionio/pio:latest predictionio/pio:$PIO_VERSION docker push predictionio/pio:$PIO_VERSION其中$PIO_VERSION对应发布版本号如v0.13.0保证latest与版本标签同步发布。六、小结与进一步探索本文围绕 docker/README.md 梳理了 Apache PredictionIO 的 Docker 化部署全貌通过 docker-compose 叠加文件自由组合 Meta / Event / Model 三类存储PostgreSQL、MySQL、Elasticsearch、LocalFS用pio-docker在容器内完成从应用注册到推荐查询的完整引擎生命周期并支持 Spark 集群训练、自动部署 Engine Server、Jupyter EDA 等进阶用法。在此基础上还可进一步阅读docker/pio/pio_run容器入口脚本理解启动等待与 Event Server / 部署脚本的分流逻辑docker/pio/Dockerfile镜像内部版本矩阵与构建过程docker/docker-compose.deploy.yml 与 docker/deploy/run.sh自动部署机制docker/docker-compose.spark.ymlSpark 集群编排docker/JUPYTER.mdJupyter 环境下的完整模板演练docker/charts面向 Kubernetes 的 Helm Chart 部署方案。【免费下载链接】predictionioPredictionIO, a machine learning server for developers and ML engineers.项目地址: https://gitcode.com/gh_mirrors/pred/predictionio创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

相关推荐

Spring AI与LangChain4j:Java工程师的AI工程化实战指南
Spring AI与LangChain4j:Java工程师的AI工程化实战指南

1. 这不是“Java vs Python”的站队,而是后端工程师的AI入场券最近刷到不少标题党说“Java要干翻Python”,甚至有人把Spring AI和LangChain4j包装成“Java版LangChain”,搞得好像学了就能秒杀算法岗。我带过二十多个Java后端团队,… · 2026/9/23 8:00:21

手机免费制作蓝白渐变证件照全攻略:从抠图到导出,十分钟搞定合规照片
手机免费制作蓝白渐变证件照全攻略:从抠图到导出,十分钟搞定合规照片

这几年证件照的要求越来越细,除了标准的红、白、蓝底,蓝白渐变底色的需求也多了起来。我最早遇到这个需求是帮家里孩子弄学籍照片,学校通知上写着“蓝白渐变背景”,当时手机里一堆修图App,真到用的时候反而不知道怎么下… · 2026/9/23 8:00:21

agent-skills 实战:为 AI coding agent 构建可复用技能层
agent-skills 实战:为 AI coding agent 构建可复用技能层

1. 从"每次都要重新教AI"说起:agent-skills到底在解决什么如果你用过 Claude Code、Cursor 这类 AI coding agent,大概率经历过这样的循环:新开一个会话,agent 对你的项目结构一无所知,你得重新解释一遍&quo… · 2026/9/23 8:00:21

3个代码坑搞懂2013年法定节假日一文
3个代码坑搞懂2013年法定节假日一文

3个代码坑搞懂2013年法定节假日一文 刚把网上抄的日历代码跑起来,报错 KeyError: '2013-01-01' ?别急着删库。这种 复制来的代码跑不通不知道怎么调… · 2026/9/23 11:01:53

OIF-CEI-5.2规范解析:56G高速链路的SNDR、ILD与均衡实战
OIF-CEI-5.2规范解析:56G高速链路的SNDR、ILD与均衡实战

简介:由光学互联论坛(OIF)于2024年发布的OIF-CEI-05.2《通用电气输入/输出(CEI)》实施协议,是面向6G、11G、25G、56G、112G bps I/O接口的电气与抖动互操作性规范。OIF成立于1998年,是拥有超100… · 2026/9/23 11:01:53

VMware 常用命令速查:从 esxcfg-vswitch 到 vmkiscsi-tool 的排障清单
VMware 常用命令速查:从 esxcfg-vswitch 到 vmkiscsi-tool 的排障清单

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views … · 2026/9/23 11:01:34

电商新决策链:内容即货架、信任即货币、场景即入口、数据即神经
电商新决策链:内容即货架、信任即货币、场景即入口、数据即神经

1. 电商不是在“卷价格”,而是在“重构用户决策链”“电商风云再起”这六个字,最近半年在行业内部会议、投资人简报和平台运营周会上被反复提起——但没人真正在说“风”从哪来、“云”往哪去。我去年深度参与了三家不同体量商家的全域经营升级项目&… · 2026/9/23 11:01:34

基于Python+Flask的旅游数据爬虫与可视化分析实践
基于Python+Flask的旅游数据爬虫与可视化分析实践

1. 项目发起的真实动机与技术选型拆解1.1 这个项目到底在解决什么问题先把这个标题拆开看——"PythonFlask爬虫大同旅游产业数据可视化分析",后缀还挂着一长串_o4skhwx7-vue pycharm django。这其实是一个非常典型的旅游数据采集与分析展示项目&#xff0… · 2026/9/23 11:01:28

最前線の Harness 設計を読み解く:Pi・Claude Code・Codex・DeepSeek を5サブシステムで比較する
最前線の Harness 設計を読み解く:Pi・Claude Code・Codex・DeepSeek を5サブシステムで比較する

最前線の Harness 設計を読み解く:Pi・Claude Code・Codex・DeepSeek を5サブシステムで比較する 【免费下载链接】learn-harness-engineering Harness engineering beginner tutorial, from 0 to 1 项目地址: https://gitcode.com/gh_mirrors/le/learn-harness-e… · 2026/9/23 11:01:20

3招搞定手机怎么下载微信面试难题实战项目解析
3招搞定手机怎么下载微信面试难题实战项目解析

3招搞定手机怎么下载微信面试难题实战项目解析 面试被问“手机怎么下载微信”背后的原理,90%的人答不上来。别笑,这看似弱智的问题,实则是考察你对移动应用分发机制、安全校验及网络协议理解的试金石。我带过不少校招新人,他们背了八股文,却连一个A… · 2026/9/23 0:00:03

你有新短消息请注意查收:3个新手避坑指南搞定消息系统选型
你有新短消息请注意查收:3个新手避坑指南搞定消息系统选型

你有新短消息请注意查收:3个新手避坑指南搞定消息系统选型 面试被问“高并发下如何保证消息不丢失”,你张口就是“用Redis”,结果面试官追问“如果Redis宕机了怎么办”,你瞬间卡壳。这种场景太常见了,很多新手在背八股文时,只记住了技术名词… · 2026/9/23 0:00:29

Win7无线热点配置工具源码解析:解决API失效的3个实战技巧
Win7无线热点配置工具源码解析:解决API失效的3个实战技巧

Win7无线热点配置工具源码解析:解决API失效的3个实战技巧 Win7无线热点配置工具在Win10/11上跑不动?不是你的问题,是版本升级后 API 全变了。很多老项目里的 netsh wlan… · 2026/9/23 0:00:36

了解更多?预约专属演示

我们的顾问将为您一对一讲解产品与方案

企业微信二维码