首页/新闻资讯/正文详情

See-through代码架构参考手册:推理管线、模型模块与训练框架逐模块API详解

发布时间:2026/9/26 12:44:09 来源:云帆数科 栏目:资讯中心
See-through代码架构参考手册:推理管线、模型模块与训练框架逐模块API详解
See-through代码架构参考手册推理管线、模型模块与训练框架逐模块API详解【免费下载链接】see-throughSingle-image Layer Decomposition for Anime Characters (SIGGRAPH 2026 Conference Paper)项目地址: https://gitcode.com/gh_mirrors/se/see-throughSee-through 是 SIGGRAPH 2026 论文开源项目可将单张动漫立绘自动拆解为最多 23 个语义图层并导出 PSD。本文作为 See-through 代码架构参考手册带你逐模块读懂它的推理管线、模型模块与训练框架 API即使你是新手也能快速定位每个目录的作用。1️⃣ 项目全景一张图看懂 See-through 代码架构See-through 的核心思路是扩散模型生成透明图层 伪深度模型推断绘制顺序LayerDiff 3D 负责把角色拆成带 Alpha 通道的语义图层Marigold 负责给每个图层估算深度最后按深度排序合成 PSD。围绕这两个核心整个仓库分成五大板块顶层目录定位关键入口inference/推理管线脚本inference_psd.pycommon/modules/可复用模型实现layerdiffuse/、marigold/annotators/标注/分割插件包animeinsseg/、lang_sam/training/训练框架与配置train/、configs/ui/Qt6 桌面标注界面launch.py2️⃣ 推理管线从一张图到 23 层 PSD 的三步走主入口 inference_psd.py 只做了三件事是理解 See-through 代码架构的最佳起点第 1 步LayerDiff 3D 图层生成—— 调用apply_layerdiff()见 inference_utils.py。它加载透明 VAETransparentVAE与 3D UNetUNetFrameConditionModelV3 模型分两个阶段推理先整图分离发型、服装等 13 个身体部件再裁剪头部区域二次分离脸部、眼睛等 11 个细部件。第 2 步Marigold 伪深度估计——apply_marigold()把各部件图层含眼睛四件套合并、前后发合并批量送入 MarigoldDepthPipeline为每个部件输出{tag}_depth.png深度图。第 3 步细粒度拆分与 PSD 导出——further_extr()完成左右拆分part_lr_split、前后发聚类cluster_inpaint_part、眼部四分眉毛/眼睛拆为 l/r最后由dump_parts_psd()按depth_median从深到浅排序输出{name}.psd与{name}_depth.psd双文件。 低显存用户有三条路径均在 inference/scripts/ 下--group_offload12GB 卡、inference_psd_quantized.pyNF4 4bit 量化8GB 卡、inference_psd_blockswap.py块交换。拿到 PSD 后还可用 heuristic_partseg.py 按深度或左右进一步切分图层。3️⃣ 模型模块详解common/modules 四大核心这是整个推理管线的发动机舱全部为 PyTorch 实现layerdiffuse/SDXL 规模的透明图层扩散。layerdiff3d.py 定义了支持num_frames与group_embedding的UNetFrameConditionModelvae.py 提供TransparentVAEEncoder/Decoder把 RGBA 图层编码进 3D 潜空间diffusers_kdiffusion_sdxl.py 的KDiffusionStableDiffusionXLPipeline用 DPM-2M 采样器驱动推理。marigold/SD 1.5 规模的深度估计管线支持多分辨率噪声multi_res_noise.py与多帧列表输入img_list参数正是 See-through 逐部件估深的来源。sam/完整移植的 SAM 模型与 predictor.py 预测器配合 extend_sam.py 做部件级分割。depth_anything_v2/Depth Anything V2 的 DINOv2 主干 DPT 解码器作为辅助深度适配器。4️⃣ annotators 标注插件系统annotators/ 是独立 pip 包为训练数据标注服务按需安装 extras模块功能核心 APIanimeinsseg/动漫实例分割mmdet3 ISNet 细化AnimeInstanceSegmenter.infer()、apply_instance_segmentation()lang_sam/GroundingDINO SAM2 语言引导分割predict_multi_prompts()lama_inpainter/LaMa 大掩码修复FFT 卷积实现见 ffc.pyapply_inpaint(img, mask)bizarre_tagger/人体姿态估计 背景分割apply_pos_estimator()wdv3_tagger.pyWD-v3 动漫标签识别apply_wdv3_tagger()anime_face_detector/动漫人脸关键点独立环境LandmarkDetector.__call__()5️⃣ 训练框架三阶段 2D→3D 升级路线training/ 产出 V3 模型23 部件标签两大模型族都遵循2D 训练 → UNet 权重转换 → 3D 微调流水线train_layerdiff.py → cvt_layerdiff2d_to_3d.py → train_layerdiff3d.py train_marigold_depth.py → cvt_marigold2d_to_3d.py → train_marigold3d.py数据集dataset_layerdiff.py、dataset_depth.py、dataset_seg.py 均支持翻转/裁剪/HSV 增强与多分辨率缩放。损失函数loss_vae.pyLPIPS ConvNeXt 感知损失 判别器、loss_depth.py仿射不变深度损失 梯度匹配、loss_mask_samhq.pyDice 不确定性采样 CE。配置training/configs/ 提供各模型 YAML 与 4/8 卡 DeepSpeed ZeRO 加速配置LayerDiff 系需accelerate launch多卡训练论文在 8×H200 上训练。数据管线data_pipeline.py 渲染增强样本benchmark.py 跑 FID/LPIPS/PSNR。6️⃣ UI 桌面标注界面ui/ 是基于 Qt6 的 Live2D 模型标注与管理工具在仓库根目录执行python ui/ui/launch.py启动。主窗口、画布、标签树分别由 mainwindow.py、canvas.py、tag_tree.py 实现推理任务跑在 run_thread.py 的独立线程中。7️⃣ 常见路径速查表我想……去看这里跑通完整推理inference/scripts/inference_psd.py改图层拆分逻辑common/utils/inference_utils.py换自己的 VAE / UNetcommon/modules/layerdiffuse/vae.py、layerdiff3d.py训练新模型training/README.md training/configs/给数据打标签ui/ui/launch.py、annotators/README.md查看 23 部件标签定义common/utils/inference_utils.py 中的VALID_BODY_PARTS_V2 提示运行任何脚本前请先在仓库根目录建立assets软链接ln -sf common/assets assets并始终以仓库根目录为工作目录——这是 See-through 代码架构中最容易被忽略的环境要求。掌握以上五大板块的职责与入口 API你已具备在 See-through 仓库中独立定位、阅读与二次开发所需的全部地图。【免费下载链接】see-throughSingle-image Layer Decomposition for Anime Characters (SIGGRAPH 2026 Conference Paper)项目地址: https://gitcode.com/gh_mirrors/se/see-through创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

相关推荐

在WSL中手动挂载Linux编译服务器项目代码:TaoToken统一Key接入Cline的config.toml骨架与验证
在WSL中手动挂载Linux编译服务器项目代码:TaoToken统一Key接入Cline的config.toml骨架与验证

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views … · 2026/9/26 12:44:09

Node.js+Vue打造社交化个人博客:相册与关注模块实战
Node.js+Vue打造社交化个人博客:相册与关注模块实战

做个人博客容易,真正把它做成带社交生态的Nodejsvue个人博客社交系统,才是大部分人栽坑的地方。这篇文章不聊虚的,直接把我做过的“个人博客社交系统”拆给你看,重点落在相册关注这两个模块上:一个是内容沉淀&#xff… · 2026/9/26 12:44:03

液压阀体加工在线测量方案:多孔系深孔找正与检测实操
液压阀体加工在线测量方案:多孔系深孔找正与检测实操

1. 液压阀体加工在线测量方案的整体设计思路液压阀体这类零件,干过机加工的人都清楚,它属于典型的“看着简单、做起来要命”的活儿。一个中型的多路阀阀体,上面密密麻麻分布着主阀孔、先导孔、油道孔、安装螺纹孔,孔系之间的位置精… · 2026/9/26 12:44:03

AI Agent Harness Engineering 教育行业创新教学与辅导应用:TaoToken 统一 Key 接入配置实战
AI Agent Harness Engineering 教育行业创新教学与辅导应用:TaoToken 统一 Key 接入配置实战

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views … · 2026/9/26 13:17:14

别再搜“DDoS发包机”了:合法压测与防御演练的正确姿势
别再搜“DDoS发包机”了:合法压测与防御演练的正确姿势

简介:面向网络安全学习者与防御研究人员的全套发包机搭建教程附带脚本包,集中讲解分布式拒绝服务攻击工具的环境配置、源码实现与自动化脚本使用,帮助读者理解攻击原理并建立防护思路。压缩包共152个文件,约50.83MB,主… · 2026/9/26 13:17:14

SQLiLabs Less-5双查询报错注入从原理到手工实战全解析
SQLiLabs Less-5双查询报错注入从原理到手工实战全解析

sqlilabs靶场是学习SQL注入绕不开的一套环境,而less-5堪称从“有回显”到“无回显”的分水岭。这一关页面永远是“You are in...”,一不显示数据,二只存在真假两种响应。很多人在前面关卡能靠union直接读出账号密码,到了这里就卡住… · 2026/9/26 13:17:14

Claude Code 第 12 篇 告别手动合并与部署:用 Claude Code Skill 打造自动化工作流(TaoToken 统一 Key 配置版)
Claude Code 第 12 篇 告别手动合并与部署:用 Claude Code Skill 打造自动化工作流(TaoToken 统一 Key 配置版)

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views … · 2026/9/26 13:17:14

基于EasyOCR的OCR文字识别系统:从环境搭建到服务封装
基于EasyOCR的OCR文字识别系统:从环境搭建到服务封装

简介:这是一份基于EasyOCR的OCR文字识别系统完整项目,面向需要实现图像文字提取的开发者、机器学习入门者,也适合作为课程设计参考。系统整合了图像输入、预处理、EasyOCR识别与结果输出等模块,预处理环节涉及灰度化、二值化、去噪… · 2026/9/26 13:17:14

Flavia叶片分类实战:从特征工程到CAM可视化的完整教学闭环
Flavia叶片分类实战:从特征工程到CAM可视化的完整教学闭环

简介:本资源是一套面向高校人工智能与计算机相关专业学生的Flavia叶片图像分类实践项目,融合传统机器学习与深度学习双路径方案,适用于课程设计、毕业设计及入门级科研实践。压缩包共12个文件,含9个Python源码(覆盖Ale… · 2026/9/26 13:17:08

数据库课后习题答案别硬背:当测试用例集刷,效率翻倍
数据库课后习题答案别硬背:当测试用例集刷,效率翻倍

简介:万常选版《数据库原理与设计》课后习题答案资源,覆盖第2至6章及第9章,适合正在学习关系模型、数据库建模、关系数据理论与模式求精的本科生、自学者作为复习与自测材料。压缩包共7个文件,含3个doc参考答案、2个sql示例脚本、… · 2026/9/26 0:00:21

OpenClaw 替代品?Hermes Agent 踩坑实录:macOS 飞书接入 TaoToken 配置
OpenClaw 替代品?Hermes Agent 踩坑实录:macOS 飞书接入 TaoToken 配置

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views … · 2026/9/26 0:00:40

向下兼容与向上兼容:接口设计中的兼容性策略与工程实践
向下兼容与向上兼容:接口设计中的兼容性策略与工程实践

一次版本升级事故,是很多团队绕不过去的坎。线上环境里,服务端明明已经上线了新版接口,老的移动端还在照着旧文档传参数。请求一到网关,校验直接拒绝,用户操作失败,客服群炸了锅,开发群里开始互… · 2026/9/26 0:00:46

了解更多?预约专属演示

我们的顾问将为您一对一讲解产品与方案

企业微信二维码