AI 技能/插件AI 评测科研人工智能MCP 服务dsh-plugin【免费下载链接】Auto-claude-code-research-in-sleepARIS ⚔️ (Auto-Research-In-Sleep) — Lightweight Markdown-only skills for autonomous ML research: cross-model review loops, idea discovery, and experiment automation. No framework, no lock-in — works with Claude Code, Codex, OpenClaw, or any LLM agent.项目地址https://gitcode.com/gh_mirrors/au/Auto-claude-code-research-in-sleep点击查看免费下载本文围绕 ARISAuto-Research-In-Sleep项目中 docs/GPU_SETUP_CN.md 一文展开系统讲解如何在项目CLAUDE.md中声明 GPU 服务器打通审稿人提出实验 → Agent 自动写脚本 → 部署 GPU → 监控结果 → 反哺论文的自动化闭环并深入剖析 Vast.ai 按需租 GPU 的完整流程与底层 skill 实现。导读ARIS 的自动审稿循环auto-review-loop中GPT-6-Astra 这类外部审稿人只负责判断做什么实验补一个消融、加一个 baseline而真正怎么跑——写实验脚本、SSH 到服务器、激活 Conda 环境、用screen后台启动、轮询结果——全部由 Claude Code 依据你项目CLAUDE.md里声明的 GPU 环境信息自动完成。本文以 docs/GPU_SETUP_CN.md 为骨架覆盖远程 SSHgpu: remote、本地 GPUgpu: local、Vast.ai 按需租赁gpu: vast三种模式的完整配置方法并结合仓库中的vast-gpu、run-experiment、monitor-experiment等 skill 源码讲清参数含义、选型逻辑、成本控制与底层调用链让你配一次、整夜无人值守跑实验。一、ARIS 自动跑实验的整体工作方式先理解整条链路再动手配置。ARIS 的自动研究循环中当审稿模型给出需要补一个消融实验或加一个 baseline 对比之类的修改意见时Claude Code 会读取项目CLAUDE.md确定实验环境gpu: remote/gpu: local/gpu: vast/gpu: modal依据实验计划或现有脚本自动编写/补全实验代码通过 SSH或本地直连把代码同步到目标机器激活环境后以screen会话后台启动训练通过/monitor-experiment轮询进度、收集结果必要时同步 WB 指标将结果写回论文进入下一轮审稿。这一设计的分工原则在 docs/GPU_SETUP_CN.md 里写得很清楚GPT-6-Astra审稿人只决定做什么实验Claude Code 根据你的CLAUDE.md搞定怎么跑。因此你配置的核心产出物就是一份结构化的CLAUDE.md服务器声明。二、三种 GPU 模式选型remote / local / vastARIS 支持三种 GPU 模式按 docs/GPU_SETUP_CN.md 与 docs/integrations/VAST_GPU_GUIDE_CN.md 的说明各自的适用场景与成本模型如下选项适用场景成本模型gpu: remote你自己有或实验室提供固定的 SSH 服务器沉没成本ARIS 当免费用gpu: local你已经在 GPU 主机上沉没成本省 SSHgpu: vast没 GPU或偶尔需要比自己拥有的更大的硬件跑单次实验按小时计费Vast.ai 自动扣款Vast.ai 模式尤其适合一次性消融实验、跑 baseline、或者为单个实验临时上 A100/H100如果训练需要一周以上自购/固定服务器通常更划算。三、模式 A远程 SSH 服务器gpu: remote如果你有一台固定的 GPU 服务器在项目CLAUDE.md中添加如下配置块原文完整保留字段注解为仓库 skill 源码补充## 远程服务器 - gpu: remote # 声明使用远程 SSH 服务器 - SSHssh my-gpu-server密钥免密登录 - GPU4x A100 - Conda 环境researchPython 3.10 PyTorch - 激活eval $(/opt/conda/bin/conda shell.bash hook) conda activate research - 代码目录/home/user/experiments/ - 后台运行用 screenscreen -dmS exp0 bash -c ...各字段的实际用途可以在 skills/run-experiment/SKILL.md 的部署逻辑中得到印证SSH 别名run-experiment的 pre-flight 检查会执行ssh server nvidia-smi --query-gpuindex,memory.used,memory.total --formatcsv,noheader把空闲 GPUmemory.used 500 MiB筛选出来用于分配Conda 激活命令部署时每个实验会创建独立的screen会话会话内先执行激活钩子再运行训练命令即screen -dmS exp_name bash -c eval $(conda_path/conda shell.bash hook) conda activate env CUDA_VISIBLE_DEVICESgpu_id python script args 21 | tee log_file代码目录作为 rsync 的远端目标目录screen每个实验一个独立 screen 会话便于隔离、后台运行与screen -ls巡检见 skills/monitor-experiment/SKILL.md。除上述字段外run-experiment还支持以下可选增强配置- code_sync: rsync # 代码同步方式默认 rsync可设为 git 走 git push/pull - wandb: false # 设为 true 自动为实验脚本注入 WB 日志 - wandb_project: my-project # WB 项目名wandb: true 时必须 - wandb_entity: my-team # WB 团队/用户可选code_sync: git时Agent 会先本地git add -A git commit git push再在服务器上git pull适合多机同步wandb: true时run-experiment会自动检查脚本中是否有import wandb没有则注入wandb.init(...)与wandb.log({...})并在目标机验证wandb status登录状态。四、模式 B本地 GPUgpu: local如果你已经身处 GPU 服务器上或本机就有 GPU不需要 SSH配置如下原文完整保留## GPU 环境 - gpu: local # 声明使用本机 GPU - 这台机器有直接 GPU 访问不需要 SSH - GPU4x A100 80GB - 实验环境YOUR_CONDA_ENVPython 3.x PyTorch - 激活前任何 Python 命令激活实验环境的命令uv, conda 等 - 代码目录/home/YOUR_USERNAME/YOUR_CODE_DIRECTORY/本地模式下run-experiment的 pre-flight 会直接执行nvidia-smiLinux CUDA对 Mac 则检查torch.backends.mps.is_available()部署时直接用CUDA_VISIBLE_DEVICESgpu_id python script args 21 | tee log_file前台/后台运行无需 rsync 与 screen 远端命令。对本地长任务可在配置中开启run_in_background: true保持对话响应。五、模式 CVast.ai 按需 GPUgpu: vast没有 GPU 服务器时ARIS 支持从 Vast.ai 按需租赁。核心思路是用户不指定 GPU 型号或硬件配置ARIS 分析你的训练任务模型大小、数据集、预估时间找到能放下的最便宜 GPU并按总成本而非仅 $/hr排序展示随后租 → 跑 → 收 → 销毁全自动。在项目CLAUDE.md添加原文完整保留并补充 skill 中支持的额外字段## Vast.ai - gpu: vast # 从 vast.ai 按需租 GPU - auto_destroy: true # 实验跑完自动销毁默认 - max_budget: 5.00 # 可选估算超过这个数会警告 - image: pytorch/pytorch:2.1.0-cuda12.1-cudnn8-devel # 可选覆盖默认 Docker 镜像参数语义依据 skills/vast-gpu/SKILL.mdgpu: vast告诉run-experiment走 Vast.ai 通道检测到vast-instances.json中有运行中的实例时直接复用否则调用/vast-gpu provision分析任务并给出选项auto_destroy: true默认实验完成后自动下载结果、销毁实例并更新状态文件杜绝闲置扣费设为false则保留实例方便你 SSH 进去查看max_budgetARIS 估算总成本超过该值时警告并在租用前再次确认不是硬阻断image可选覆盖默认的pytorch/pytorch:2.1.0-cuda12.1-cudnn8-devel镜像。5.1 五步准备工作完整准备流程见 docs/integrations/VAST_GPU_GUIDE_CN.md英文版见 docs/integrations/VAST_GPU_GUIDE.md注册 Vast.ai 账号并充值信用卡或加密货币安装vastaiCLI要求 Python ≥ 3.10版本较旧时用conda create/pyenv/uv venv建 ≥ 3.10 虚拟环境pip install vastai设置 API keyvastai set api-key YOUR_API_KEY上传 SSH 公钥——租任何实例前必须先做因为 key 在实例创建时就写死了ssh-keygen -t ed25519 -C your_emailexample.com cat ~/.ssh/id_ed25519.pub # 复制到 Vast.ai验证配置——测试搜索能否跑通vastai search offers gpu_ram24 reliability0.95 -o dph --limit 3其中key 在创建时写死这条规则在 skills/vast-gpu/SKILL.md 中被反复强调如果实例创建后才上传 key 导致 SSH 报Permission denied (publickey)只能销毁实例、上传 key 后重建——没有给运行中实例补 key 的办法。5.2 ARIS 如何挑选 GPU 并展示成本排序表ARIS 不要求你指定 GPU 型号而是通过vast-gpuskill 做四步分析详见 skills/vast-gpu/SKILL.mdStep 1分析任务需求。优先从实验计划refine-logs/EXPERIMENT_PLAN.md读取计算预算、硬件提示、模型架构与数据集规模其次扫描已写好的实验脚本模型类、num_parameters、batch size、序列长度、是否使用DataParallel/DistributedDataParallel/accelerate/deepspeed最后才回退到用户的一句话描述如 fine-tune LLaMA-7B。Step 2估算硬件需求。核心估算规则因素估算方法最小 VRAM模型参数量 × 4 字节fp32或 × 2fp16/bf16 优化器状态 激活值经验值7B ≈ 16 GBfp16、13B ≈ 28 GB、70B ≈ 140 GB需多卡、ResNet/ViT ≈ 4–8 GB另加 20% 余量GPU 数量默认 1 张除非单卡放不下、脚本用了 DDP/FSDP/DeepSpeed、或计划明确多卡预估时长来自计划成本列或(数据集大小 × epochs) / (吞吐 × batch_size)再加 30% 缓冲最小磁盘20 GB 基础 模型 checkpoint 数据集默认 50 GBCUDA 版本匹配 PyTorchPyTorch 2.x 需要 CUDA ≥ 11.8默认 12.1Step 3跨档位搜索报价。skill 要求广泛搜索、不要限定单一 GPU 型号分预算档gpu_ramMIN_VRAM num_gpusN reliability0.95 inet_down100与高显存档VRAM 24 GB 时gpu_ram48分别执行vastai search offers。Step 4按预估总成本排序展示 3 个选项。展示时必须给出总价$/hr × 预估时长并给出任务分析摘要例如Task analysis: - Model: [model name/size] → estimated VRAM: ~[X] GB - Training: ~[Y] hours estimated - Requirements: [N] GPU(s), ≥[X] GB VRAM, ~[Z] GB disk Recommended options (sorted by estimated total cost): | # | GPU | VRAM | $/hr | Est. Hours | Est. Total | Reliability | Offer ID | |---|-------------|-------|--------|------------|------------|-------------|-----------| | 1 | RTX 3060 | 12 GB | $0.04 | ~6h | ~$0.25 | 99.4% | 25831376 | ← cheapest | 2 | RTX 4090 | 24 GB | $0.28 | ~4h | ~$1.12 | 99.2% | 6995713 | ← best value | 3 | A100 SXM | 80 GB | $0.95 | ~2h | ~$1.90 | 99.5% | 7023456 | ← fastest为跨档位估算时长skill 内置了一张相对速度FP16对照表RTX 3060 0.5×、RTX 3090 1.0×、RTX 4090 1.6×、A100 SXM 2.0×、H100 SXM 3.3× 等。选择时遵循的关键规则包括可靠性低于 0.97 的便宜选项要标注中断风险约 3%小于 1 小时的小任务推荐中断定价进一步降本可靠性低于 0.95 的主机可能中途崩溃不推荐。5.3 手动控制/vast-gpu 命令不想走/run-experiment自动流程时可以用专门的vast-gpuskill 手动控制skills/vast-gpu/SKILL.md/vast-gpu # 交互式搜索、挑选、租用 /vast-gpu provision # 分析任务 展示成本排序选项 /vast-gpu rent offer_id # 租用指定 offer /vast-gpu list # 列出当前所有租用中的实例 /vast-gpu destroy instance-id # 手动销毁 /vast-gpu destroy-all # 销毁全部实例租用实例的关键步骤provision之后的rent动作用vastai create instance OFFER_ID --image DOCKER_IMAGE --disk DISK_GB --ssh --direct --onstart-cmd apt-get update apt-get install -y git screen rsync创建实例输出中的new_contract值就是实例 ID随后每 20 秒轮询vastai show instances --raw直到状态从loading变为running通常 30–60 秒最长约 5 分钟连接信息必须通过vastai ssh-url INSTANCE_ID获取返回ssh://rootHOST:PORT格式不要依赖show instances里的ssh_host/ssh_port它们可能指向代理服务器最后用ssh -o StrictHostKeyCheckingno -o ConnectTimeout15 -p PORT rootHOST nvidia-smi echo CONNECTION_OK验证连通性。所有活跃实例都会记录在项目根目录的vast-instances.json状态文件中它是/run-experiment与/monitor-experiment连接实例的事实来源source of truth[ { instance_id: 33799165, offer_id: 25831376, gpu_name: RTX_3060, num_gpus: 1, dph: 0.0414, ssh_url: ssh://root1.208.108.242:58955, ssh_host: 1.208.108.242, ssh_port: 58955, created_at: 2026-03-29T21:12:00Z, status: running, experiment: exp01_baseline, estimated_hours: 4.0, estimated_cost: 0.17 } ]5.4 成本预期与止损手段按 docs/integrations/VAST_GPU_GUIDE_CN.md 给出的典型工作负载花费区间小型消融实验单 GPU1–4 小时约 $0.30–$2 / 次RTX 3090/4090较大的 baseline 重跑40–80 GB VRAM多小时约 $2–$10 / 次A100/H100Spot 价格波动较大vastai search offers反映实时市场价。止损手段设置max_budget让 ARIS 在超预算前确认auto_destroy: true让实例跑完即销毁/vast-gpu list或vastai show instances随时核查没有静默扣费的实例——Vast.ai 按秒计费闲置实例就是浪费。六、部署全链路从 /run-experiment 到自动销毁理解了三种模式的配置后再看完整部署链skills/run-experiment/SKILL.md检测环境读CLAUDE.md确定模式gpu: vast时优先复用vast-instances.json中运行中的实例无则调用/vast-gpu provision完全找不到服务器信息则询问用户Pre-flight 检查确认目标机 GPU 可用nvidia-smi空闲 memory.used 500 MiB同步代码remote 走 rsync 或 gitVast.ai 实例固定 rsync 到/workspace/project/默认排除大文件与数据*.pt、*.pth、*.ckpt、__pycache__、.git、data/、wandb/、outputs/部署remote 用screen -dmS exp_name bash -c ...在远端后台启动Vast.ai 无需 condaDocker 镜像自带环境在/workspace/project/下直接启动每个实验独立 screen 会话 独立 GPU日志用tee落盘验证启动screen -ls确认会话存在飞书通知可选若配置了~/.claude/feishu.json发送experiment_done通知自动销毁gpu: vast且auto_destroy: true时实验结束后 rsync 回收results/、scp 回收日志、vastai destroy instance ID、更新状态文件并报告实际成本。监控侧skills/monitor-experiment/SKILL.md会读取vast-instances.json的ssh_host/ssh_port连入实例screen -ls查看运行状态、screen -S name -X hardcopy截取最近输出、检查 JSON 结果文件并在wandb: true时通过 Python API 拉取 loss 曲线、eval 指标与学习率调度最后以对比表形式汇总实验/指标/相对 baseline 的 Delta/状态并提示闲置实例的实时成本。七、计算环境契约让环境就绪不再是玄学对每次实验都要重建环境的 Vast.ai 场景ARIS 用 skills/shared-references/compute-env-contract.md 定义了一套计算环境契约把环境描述成一份声明式 specbase基础镜像、system_pkgs系统包、有序的pip_phases、env环境变量、smoke探针并按内容哈希记录在.aris/compute/provider.md账本里——spec 没变就 warm-reuse变了才重建。pip_phases的有序性是关键每个 phase 是一次独立的pip install先把最容易打架的包如torch2.8.0固定在最前面的 phase后面再装flash-attn --no-build-isolation、transformers等避免后装包把 torch 拖到错误的 wheel 上。验证分三级import成功最弱→kernel-dispatch witness跑一个带固定种子的前向传播打印 sentinel 行捕获torch 看得到 GPU 但 kernel 按更老的 SM 编译这类问题→agent-follows-doc让一个全新 subagent 只凭文档原文逐字执行其卡住之处就是文档的谎言。诊断表则覆盖常见症状no kernel image is available、ModuleNotFoundError、.so加载失败、线程风暴、输出目录为空等并给出对应修复层。八、没有 GPU 服务器怎么办按照 docs/GPU_SETUP_CN.md 的说明没有 GPU 服务器时Review 和改写功能不受影响——/auto-review-loop、/research-review、/paper-writing、/paper-compile等 skill 完全不依赖 GPU只有需要跑实验的修复会被跳过并标记为需人工跟进。同时ARIS 自动循环内置了成本护栏见 README_CN.md预估超过4 GPU-小时的实验会直接跳过并标记需人工跟进避免 Agent 深夜盲目启动超大任务。再配合max_budget、auto_destroy与vastai show instances巡检即可在无人值守的前提下把 GPU 开销锁在可控范围内。相关资源导航docs/GPU_SETUP_CN.md —— 本文主文档英文版 docs/GPU_SETUP.mddocs/integrations/VAST_GPU_GUIDE_CN.md —— Vast.ai 集成完整指南英文版 docs/integrations/VAST_GPU_GUIDE.mdskills/vast-gpu/SKILL.md —— GPU 租赁控制 skill 完整源码skills/run-experiment/SKILL.md —— 实验部署 skill含三种模式完整配置示例skills/monitor-experiment/SKILL.md —— 结果监控 skillskills/shared-references/compute-env-contract.md —— 计算环境契约skills/serverless-modal/SKILL.md —— 另一种无 GPU 方案Modal 无服务器 GPU赞分享AI 技能/插件AI 评测科研人工智能MCP 服务dsh-plugin【免费下载链接】Auto-claude-code-research-in-sleepARIS ⚔️ (Auto-Research-In-Sleep) — Lightweight Markdown-only skills for autonomous ML research: cross-model review loops, idea discovery, and experiment automation. No framework, no lock-in — works with Claude Code, Codex, OpenClaw, or any LLM agent.项目地址https://gitcode.com/gh_mirrors/au/Auto-claude-code-research-in-sleep点击查看免费下载相关推荐ARIS 按需 GPU 实验自动化Vast.aigpu: vast集成实战指南ARIS 按需 GPU 实验自动化Vast.aigpu: vast集成实战指南 本文是 ARIS 项目 GPU 服务器配置 https://link.giAI 技能/插件AI 评测科研人工智能MCP 服务dsh-pluginARIS 按需 GPU 租用实战在 Vast.ai 上零硬件完成实验自动化ARIS 按需 GPU 租用实战在 Vast.ai 上零硬件完成实验自动化 本指南以 ARIS 的 VAST_GPU_GUIDE.md https://linAI 技能/插件AI 评测科研人工智能MCP 服务dsh-pluginARIS 计算环境契约实战指南用声明式 Spec、内容哈希台账与三级验证终结 Agent 环境漂移ARIS 计算环境契约实战指南用声明式 Spec、内容哈希台账与三级验证终结 Agent 环境漂移 本文以 skills/shared references/AI 技能/插件AI 评测科研人工智能MCP 服务dsh-plugin创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
企业数字化 ERP 产品动态
相关推荐
动漫数据爬取与分析实战:从公开API到可视化呈现 做动漫数据爬取与分析这个项目,起初并不是为了搞一个多复杂的数据平台。我在社区里看到太多人争论“这几年新番质量是不是下降了”“热血番是不是比恋爱番更容易拿高分”,吵到最后谁都没数据。于是我就想,干脆把动画条目、评分、类型、放送年… · 2026/9/23 2:57:49
FineReport替代与报表迁移实战:选型、迁移与校验解析 1. 为什么2026年大家都在看FineReport的替代方案先说个挺直观的现象:这两年聊报表选型,FineReport被问到的频率明显降了,取而代之的是一堆“你们家报表工具能不能平迁”“数据集能不能复用”“权限模型能不能对得上”这类问题。2026年这个时间… · 2026/9/23 2:57:49
vivo6x源码解析3招解决代码跑不通 vivo6x源码解析3招解决代码跑不通 复制来的代码在 vivo6x 上直接报错?别慌,这不是手机不行,是你没看懂底层逻辑。很多开发者盯着报错信息发呆,却不知道 源码解析 才是解决兼容性与性能卡顿的钥匙。今天我们就以 vivo6x… · 2026/9/23 2:57:49
学生党U盘选购指南:安全、速度与容量全解析 1. 学生党U盘选购痛点解析作为一名在校园里摸爬滚打多年的老学长,我深知U盘对学生的重要性。从大一入学时懵懂地买了个杂牌U盘导致期末论文丢失,到现在帮学弟学妹们挑选过上百个U盘,我总结出学生党选购U盘的三大核心痛点:数据安全… · 2026/9/23 4:59:19
AI项目依赖更新实战:从锁版本到自动化验证的完整指南 1. 为什么“依赖更新”这件事值得单独拎出来聊做 AI 应用开发的人,大概率都经历过这样一个场景:项目跑得好好的,某天早上打开终端,pip install -r requirements.txt或者npm install一执行,满屏红色报错。你什么都没改&… · 2026/9/23 4:59:19
Agent记忆层实战:从上下文窗口困境到抽取、整合、存储与检索全解 做 Agent 做了大半年,我最大的感受是:模型能力已经不怎么卡脖子了,真正卡脖子的是“记忆”。你看各家模型厂商拼命把上下文窗口从 8K 干到 128K、200K、1M,好像只要窗口够大,Agent 就无所不能。真到了生产环境你会发现… · 2026/9/23 4:59:19
向量工程:从数学定义到可编程基础设施的实战指南 1. 这不是课本里的向量,是能跑通代码、能调通模型、能看懂论文的向量“线性代数(第三章:向量)”——看到这个标题,很多人第一反应是大学教室里粉笔灰飘在阳光里的午后,黑板上写着 $\vec{v} (x, y, z)$&… · 2026/9/23 4:59:19
Welsh算法灰度图像彩色化:原理、Python实现与优化实战 简介:面向计算机相关专业学生及实践者的一套灰度图像彩色化处理与优化实现资源,适合毕业设计、课程设计、算法进阶及实际项目借鉴。基于Welsh颜色转移算法完成灰度图自动着色,再引入导向滤波进行去噪与边缘保留优化,解决传统滤波在… · 2026/9/23 4:59:12
3分钟一文搞懂then的意思:Promise异步流避坑指南 3分钟一文搞懂then的意思:Promise异步流避坑指南 版本升级后 API 全变了,原本跑得好好的 async/await 突然报错,或者回调地狱里突然冒出一个 then 让你抓耳挠腮?别慌,这不是玄学,是 JavaScript… · 2026/9/23 4:59:05
3招搞定手机怎么下载微信面试难题实战项目解析 3招搞定手机怎么下载微信面试难题实战项目解析 面试被问“手机怎么下载微信”背后的原理,90%的人答不上来。别笑,这看似弱智的问题,实则是考察你对移动应用分发机制、安全校验及网络协议理解的试金石。我带过不少校招新人,他们背了八股文,却连一个A… · 2026/9/23 0:00:03
你有新短消息请注意查收:3个新手避坑指南搞定消息系统选型 你有新短消息请注意查收:3个新手避坑指南搞定消息系统选型 面试被问“高并发下如何保证消息不丢失”,你张口就是“用Redis”,结果面试官追问“如果Redis宕机了怎么办”,你瞬间卡壳。这种场景太常见了,很多新手在背八股文时,只记住了技术名词… · 2026/9/23 0:00:29