如何中断与恢复 Spirula Studio 训练checkpoint 断点续训完整指南【免费下载链接】spirula-studioCross-vendor 3D Gaussian Splatting trainer - video to splat to mesh, Vulkan or CUDA.项目地址: https://gitcode.com/GitHub_Trending/sp/spirula-studioSpirula Studio 是一款跨厂商Vulkan / CUDA的 3D Gaussian Splatting 训练器覆盖视频 → splat → 网格的完整流程。面对动辄数万步的长训练断电、显存不足或临时想调参都是家常便饭——本文将带你掌握它的 checkpoint 断点机制如何优雅中断训练、checkpoint 目录里到底存了什么、以及怎样用--resume一键断点续训让训练随时停、随时续。训练中断的 3 种方式Spirula Studio 的中断设计围绕一个核心思想定期自动存档任何时刻退出都能找回最近进度。CLI 直接退出spirula train按CtrlC终止进程。训练器默认每steps_per_save步默认 2000 步见 src/config/TrainConfig.h自动保存一次 checkpoint即使进程被强制结束也能回退到最近一次存档继续。GUI 停止训练图形界面的训练会话支持 pause/stop导航离开或退出时会弹出停止并保存确认框实现见 src/app/gui/TrainRunner.h 与 src/app/README.md确认后即可安全离开。只留最新存档save_only_latest_checkpoint默认为true每次保存后自动清理旧 checkpoint 目录磁盘上始终只保留最近一份省去手动清理。认识 checkpoint 目录step-*.ckpt 里都有什么每次存档都会在运行目录run dir下生成一个形如step-000002000.ckpt/的文件夹结构如下命名与解析逻辑见 src/checkpoint/Resume.hrun_dir/ ├── config.json # 本次运行的完整训练配置 ├── step-000002000.ckpt/ # 一个存档点 │ ├── state.tar # 续训载荷state.json 清单 每块 GPU 缓冲一个 .npy │ └── splat.ply # 推理产物过滤、反量化后可直接渲染/建网格的高斯 └── step-000004000.ckpt/ # 下一个存档点……state.tar是一个零依赖的 tar 包内含state.json步数、高斯数量、SH 阶数等运行时清单和按池槽命名的扁平.npy数组。读写工具全部内建无需 Python 环境格式实现见 src/core/CheckpointIO.h 与 src/engine/EngineCheckpoint.cpp。splat.ply是随时可交付的成果无论你是否续训它都可以直接交给spirula-mesh做网格提取或在 Web 查看器中查看。存档时 GPU 缓冲分块拷回主机不额外占用显存多 GB 级别的状态也能稳定落盘。断点续训的前提先开启 save_full_checkpoint这是新手最容易踩的坑 ⚠️默认情况save_full_checkpoint falsecheckpoint 只保存推理/外观参数和splat.ply不含世界高斯参数与优化器状态无法恢复训练。开启--save-full-checkpoint 1后存档才会额外写入全部世界参数与优化器状态成为可续训的完整 checkpoint。恢复前程序会做资格检查check_resumable见 src/checkpoint/Resume.cpp若检测到该存档不可续训会提前报出清晰错误并提示你重跑源训练时加上--save-full-checkpoint 1而不是加载到一半才失败。这类存档仍然可用于推理和建网格。 建议任何预计要分阶段完成、或可能中途调整的长训练都从启动就开启该开关。一键恢复--resume 的两种用法恢复入口是--resume参数解析与配置合并逻辑见 src/checkpoint/Resume.h 和 src/app/TrainerCore.cpp支持两种写法1️⃣ 指向运行目录 —— 自动选最新存档./build_vulkan/spirula train --resume outputs/myrun-20260925程序会按step-*命名规则找到该目录下编号最大的 checkpoint数字填充命名保证字典序即数值序见 src/checkpoint/Resume.cpp。2️⃣ 指向具体存档 —— 精确回退到某一步./build_vulkan/spirula train --resume outputs/myrun-20260925/step-000030000.ckpt恢复时的配置合并规则续训不是盲恢复配置按以下优先级分层叠加checkpoint 自带的config.json作为基础——它记录了当初架构参数因此续训时甚至不需要再传--data输出目录默认回到原 run 文件夹新存档、评估图与日志和旧的一起存放命令行上指定的 preset 会重新施加其覆盖项显式传入的命令行参数优先级最高程序记录的是你实际敲了哪些参数而非与默认值比较因此把某项改回默认值也生效。恢复动作本身发生在引擎骨架搭建完成后按state.json重建优化器布局再逐块把.npy拷回 GPU步数从存档处继续优化器动量、学习率状态完整延续。想改参数布局checkpoint 会自动适配续训时如果改变了模型布局Spirula Studio 也能处理适配逻辑在 src/checkpoint/Adapt.cpp调小cap_max优先丢弃尾部未饱和的高斯再按最低不透明度淘汰其余参数无损迁移更换sh_degree、增删 bilagrid / PPISP 通道缓冲在主机侧重写为目标布局全程不分配显存——这正是为上次训练显存爆了、换个更小布局续训的场景设计的量化缓冲会经过引擎自己的编解码器解码再重编码与训练核共用同一份代码路径。适配完成后引擎拿到的就是一个普通的state.tar后续流程与同布局续训完全一致。顺便区分--init-ply 热启动 ≠ 断点续训--init-ply file.ply|run_dir|step-*.ckpt用已训练好的 PLY 作为初始高斯启动全新训练步数从 0 开始、优化器从零起步。适合数据集扩充后在旧模型上继续精修而--resume才是原封不动接着练。两者同时给出时--resume优先并给出提示。常见问题速查问题原因与对策checkpoint ... is NOT resumable该存档未开save_full-checkpoint只含推理参数重训时加--save-full-checkpoint 1该存档仍可拿splat.ply做推理/建网格no state.tar or step-*.ckpt found路径既不是 run 目录也不是.ckpt目录确认指向的是run_dir或run_dir/step-*.ckpt本身max_num_splats mismatch手动改了容量且超出自动适配范围让cap_max不增大或依赖布局适配流程磁盘紧张保持save_only_latest_checkpoint 1默认即开启只留最新一份存档小结掌握 Spirula Studio 的断点续训只需要记住三步训练前预计长训练就加--save-full-checkpoint 1这是续训的门票中断时随时CtrlC或 GUI 停止——每 2000 步可调的自动存档是天然的安全网恢复时--resume指向 run 目录最新或具体step-*.ckpt定点配置自动合并布局变更还能自适应重写。更多细节可参阅官方文档索引 docs/README.md 与应用说明 src/app/README.md 中的 Resume 章节让长训练从此没有从头再来。【免费下载链接】spirula-studioCross-vendor 3D Gaussian Splatting trainer - video to splat to mesh, Vulkan or CUDA.项目地址: https://gitcode.com/GitHub_Trending/sp/spirula-studio创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
企业数字化 ERP 产品动态
相关推荐
拒绝流量孤岛:网站开发思维导图与工具对比评测指南 拒绝流量孤岛:网站开发思维导图与工具对比评测指南 网站做好了没人访问,是无数创业团队负责人深夜最焦虑的时刻。你花了三个月开发,服务器租了最贵的,域名也选了最短的,结果上线一个月,后台数据显示 UV 只有个位数。别急着怪百度算法,90%… · 2026/9/27 7:36:33
MySQL数据导入与清洗 在现代数据分析的工作流程中,数据导入与清洗是最基础且重要的环节。无论是通过CSV、Excel,还是SQL文件进行数据导入,数据清洗的操作对于数据的质量至关重要。高质量的数据源是后续分析的根本,数据清洗可以帮助分析者获得干净、整洁且可靠的数据集,减少数据噪音,提升分析的… · 2026/9/27 7:36:33
MySQL用户与权限管理 MySQL 是一种广泛使用的关系型数据库管理系统,支持多用户访问和权限控制。在多用户环境下,数据库安全至关重要,而用户和权限管理是数据库管理中最基础也是最重要的一部分。通过合理地创建和管理用户、分配和管理权限、使用角色权限,可以有效地保护数据库,确保数据的安全性… · 2026/9/27 7:36:26
自已怎样网站别乱买,3步搞定性能优化与备案 自已怎样网站别乱买,3步搞定性能优化与备案 别再被那些“一键生成”的模板网站骗了。看着界面花里胡哨,打开慢得像蜗牛,改个颜色都要找客服排队三天,这种“模板网站太丑不够用”的痛点,多少创业团队负责人都踩过坑。 更糟心的是,模板站往往在… · 2026/9/27 8:22:14
Microsoft AI Lab 仓库导览:体验、学习与编码微软 AI 最新创新 示例工程 【免费下载链接】ailab Experience, Learn and Code the latest breakthrough innovations with Microsoft AI 项目地址: https://gitcode.com/gh_mirrors/ai/ailab 点击查看 免费下载 Microsoft AI Lab 是微软面向开发者社区推出的 AI 实验开源项目&… · 2026/9/27 8:22:14
物理机与虚拟化资源碎片整理与容量再平衡 物理机与虚拟化资源碎片整理与容量再平衡在支撑大促的超大规模底层算力机群(如 2,000 台 128 核 512GB 内存的高规格裸金属物理机)长期运维中,存在着一个吞噬企业巨额算力资本的“隐形黑洞”——“计算资源碎片化与被搁浅的死算力(… · 2026/9/27 8:22:14
商业化定价战术(四):阶梯式返点与代理商分销渠道激励机制设计实战 商业化定价战术(四):阶梯式返点与代理商分销渠道激励机制设计实战在企业级软件与 AI 中台的全国性市场扩张中,依靠初创公司内部十来个人的直销团队(Direct Sales),无论是人力覆盖半径还是行业深… · 2026/9/27 8:22:08
MATLAB雷达信号脉冲压缩仿真:LFM线性调频、匹配滤波与距离分辨率实现 简介:这套Matlab仿真工具完整呈现雷达信号脉冲压缩过程,从线性调频(LFM)信号生成、目标回波仿真到匹配滤波压缩处理均有可运行代码支撑,面向电子信息工程、计算机、数学等专业学生,适用于课程设计、期末大作… · 2026/9/27 0:00:01
汕头网站建设制作厂家避坑指南:5大注意事项救急 汕头网站建设制作厂家避坑指南:5大注意事项救急 改个需求建站公司拖一周,这种憋屈事我见得太多了。 很多汕头老板找本地建站团队,签合同前看着方案挺美,一上线就变脸。 今天不聊虚的,直接拆解找 汕头网站建设制作厂家 时的5个核心 注意事项… · 2026/9/27 0:00:01
多模态虚假新闻检测实战:BERT+ResNet双塔与对比学习 简介:基于PyTorch的多模态虚假新闻检测项目完整代码包,面向自然语言处理与计算机视觉交叉方向的开发者、科研人员及毕业设计选题者,解决社交媒体中文本与图像联合识别虚假新闻的问题。系统以BERT预训练模型提取文本语义特征,以Res… · 2026/9/27 0:00:01
MATLAB雷达信号脉冲压缩仿真:LFM线性调频、匹配滤波与距离分辨率实现 简介:这套Matlab仿真工具完整呈现雷达信号脉冲压缩过程,从线性调频(LFM)信号生成、目标回波仿真到匹配滤波压缩处理均有可运行代码支撑,面向电子信息工程、计算机、数学等专业学生,适用于课程设计、期末大作… · 2026/9/27 0:00:01
汕头网站建设制作厂家避坑指南:5大注意事项救急 汕头网站建设制作厂家避坑指南:5大注意事项救急 改个需求建站公司拖一周,这种憋屈事我见得太多了。 很多汕头老板找本地建站团队,签合同前看着方案挺美,一上线就变脸。 今天不聊虚的,直接拆解找 汕头网站建设制作厂家 时的5个核心 注意事项… · 2026/9/27 0:00:01
多模态虚假新闻检测实战:BERT+ResNet双塔与对比学习 简介:基于PyTorch的多模态虚假新闻检测项目完整代码包,面向自然语言处理与计算机视觉交叉方向的开发者、科研人员及毕业设计选题者,解决社交媒体中文本与图像联合识别虚假新闻的问题。系统以BERT预训练模型提取文本语义特征,以Res… · 2026/9/27 0:00:01