首页/新闻资讯/正文详情

把二进制变回 C 代码:LLM4Decompile 大模型反编译快速上手指南

发布时间:2026/9/24 13:50:15 来源:云帆数科 栏目:资讯中心
把二进制变回 C 代码:LLM4Decompile 大模型反编译快速上手指南
把二进制变回 C 代码LLM4Decompile 大模型反编译快速上手指南【免费下载链接】LLM4DecompileReverse Engineering: Decompiling Binary Code with Large Language Models项目地址: https://gitcode.com/GitHub_Trending/ll/LLM4Decompile老系统丢了源码或者手里只有第三方库的编译产物需要搞清里面的代码到底在干什么LLM4Decompile 用大语言模型做二进制反编译把 Linux x86_64 二进制还原成可读的 C 代码适合逆向工程师、安全研究人员和遗留系统维护者。模型权重、训练数据与评测脚本全部开源。 为什么值得试 LLM4Decompile它是专用反编译模型不是通用聊天机器人。通用大模型很少见过二进制让它反编译基本只能靠猜。LLM4Decompile 有专门的二进制-源码配对训练集decompile-bench 数据集从 1 亿条采集到的函数对中浓缩出 200 万条高质量配对另留 7 万条做评测指标是再执行率——反编译出的代码必须真的能通过测试用例而不是看起来像。两条路线可选效果差一档。V1.5 系列End直接把汇编翻译成 CV2 系列Ref让模型润色 Ghidra 先写好的伪代码草稿效果更好。模型参数量再执行率模型输入llm4decompile-6.7b-v1.56.7B45.4%汇编指令llm4decompile-6.7b-v26.7B52.7%Ghidra 伪代码llm4decompile-9b-v29B64.9%Ghidra 伪代码 三步跑起来 LLM4Decompile装环境克隆仓库并安装依赖。README 建议 Python 3.9官方做法是先用 conda 建好隔离环境再安装git clone https://gitcode.com/GitHub_Trending/ll/LLM4Decompile cd LLM4Decompile pip install -r requirements.txt做预处理用 GCC 把你的 C 代码编译成二进制再用 objdump 反汇编成汇编截取目标函数。最终输入形如函数名:加若干指令行外面套上两行固定提示# This is the assembly code:和# What is the source code?。主 README 给出了完整的预处理与推理代码只需替换函数名和文件路径。跑推理或跑 demo模型需要 CUDA GPU以 bfloat16 精度加载。嫌环境麻烦可以用仓库自带的 Docker 镜像里面预装好 Ghidra 和 OpenJDK 17构建后用docker run --gpus all进入容器直接执行ghidra/demo.py就能看到Ghidra 伪代码 → 模型润色的完整效果。 二进制反编译是怎么实现的先明确一点LLM 只懂文本没法直接处理 0/1 流。所以项目先用 objdump 把二进制反汇编成汇编——二进制与汇编可互转、信息等价——再把汇编进、C 代码出当成纯粹的文本翻译任务。训练过程正好是编译的逆过程源码经过预处理、编译、汇编、链接变成二进制再反汇编回汇编模型从这些汇编 → 源码配对上学习把译文翻回原文损失直接对原始源码计算。可以这样类比编译器是位把中文译成英文的译者反编译模型则是从海量译文对照里学会把英文翻回中文。V2 的 Ref 路线走了条近路Ghidra 先把二进制拆成伪代码逻辑大体对但变量全是 local_28语法也别扭模型的任务就是给这份半成品润色成能编译的 C。两条路线的推理代码写法相同只是输入不同——主 README 的预处理脚本走 objdumpghidra/目录的demo.py调 Ghidra Headless。 项目里哪些目录值得看ghidra/Ref 路线的入口demo.py一个脚本走完编译 → Ghidra 反编译 → 模型润色全流程是看效果最快的地方。decompile-bench/训练与评测数据外加再执行率、编辑相似度两个指标脚本拿来对自己的输出打分很方便。sk2decompile/2025 年新增的两阶段框架实现把恢复函数结构和给变量起名拆成两个模型含数据预处理、训练配置与强化学习奖励函数。⚠️ 二进制反编译的避坑指南只支持 Linux x86_64。优化级别覆盖 GCC 的 O0 到 O3其他架构和平台的产物没有验证过README 也说明更多架构还在逐步支持中。V1.5 与 V2 输入不通用。前者要 objdump 汇编后者要 Ghidra 伪代码评测数据文件也分decompile-eval-executable-gcc-obj.json和-gcc-ghidra.json两份配错文件结果没法解释。留意 token 长度。模型最大序列 4096调generate时max_new_tokens要留在这个范围以内过长的函数建议先拆分。 看完项目还能做什么如果只有一张 A100 40G可以从 decompile-ghidra-100k 子集开始复现官方脚本约 3.5 小时训完GPU 花费不到 20 美元就能得到一个可用的 Ref 模型是理解整套训练管线成本最低的入口。【免费下载链接】LLM4DecompileReverse Engineering: Decompiling Binary Code with Large Language Models项目地址: https://gitcode.com/GitHub_Trending/ll/LLM4Decompile创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

相关推荐

GitLens Webview 可访问性规范与键盘导航模式实战指南
GitLens Webview 可访问性规范与键盘导航模式实战指南

开发工具版本控制 【免费下载链接】vscode-gitlens Supercharge Git inside VS Code and unlock untapped knowledge within each repository — Visualize code authorship at a glance via Git blame annotations and CodeLens, seamlessly navigate and explore Git reposit… · 2026/9/24 13:50:09

【Coze】【图文】老年人治愈系插画
【Coze】【图文】老年人治愈系插画

今天给大家演示一个 老年人治愈系插画 Coze 工作流,通过结合大模型与图像生成的能力,实现从文字设定到场景构思,再到插画产出的完整链路。这个工作流不仅能根据输入的角色风格和文本,生成温暖宁静的日常场景描述,还能将其转化为治愈系插画,形成图文并茂的效果。借助批处理… · 2026/9/24 13:50:09

【Coze】【视频】书单诗词工作流
【Coze】【视频】书单诗词工作流

今天给大家演示一个 书单诗词 Coze 工作流。这个工作流将文本生成、语音合成与视频排版紧密结合,通过大模型抽取书籍中的精彩金句,再配合音频与画面合成,实现从文字到短视频的一键式自动化创作。无论是读书博主、诗词爱好者,还是想要快速生成内容的创作者,都能借助该流程高… · 2026/9/24 13:49:51

Comp AI CRM 国际化 SEO 审计指南:Hreflang、Canonical 与国际 Sitemap 的完整实战手册
Comp AI CRM 国际化 SEO 审计指南:Hreflang、Canonical 与国际 Sitemap 的完整实战手册

后端前端CRM人工智能AI Agent 【免费下载链接】crm Comp AI CRM is an open source, CRM designed for AI agents. Agentic-first CRM. 项目地址: https://gitcode.com/gh_mirrors/crm48/crm 点击查看 免费下载 本文以 Comp AI CRM 仓库内 seo-audit 技能的国际化 … · 2026/9/24 14:25:23

5 步搞定 OneNote 笔记备份,考研党快速找回 408 复习资料
5 步搞定 OneNote 笔记备份,考研党快速找回 408 复习资料

5 步搞定 OneNote 笔记备份,考研党快速找回 408 复习资料 【免费下载链接】cs-408 计算机考研专业课程408相关的复习经验,资源和OneNote笔记 项目地址: https://gitcode.com/GitHub_Trending/cs/cs-408 换了台新电脑登录 OneNote,同步… · 2026/9/24 14:25:23

把分散影视源装进一个遥控器:TVBoxOSC 电视盒子聚合播放框架
把分散影视源装进一个遥控器:TVBoxOSC 电视盒子聚合播放框架

把分散影视源装进一个遥控器:TVBoxOSC 电视盒子聚合播放框架 【免费下载链接】TVBoxOSC TVBoxOSC - 一个基于第三方项目的代码库,用于电视盒子的控制和管理。 项目地址: https://gitcode.com/GitHub_Trending/tv/TVBoxOSC 晚上十点,遥… · 2026/9/24 14:25:23

yaml-cpp 跨平台编译指南:Windows、Linux、macOS 下的 CMake 配置、常见错误与项目集成
yaml-cpp 跨平台编译指南:Windows、Linux、macOS 下的 CMake 配置、常见错误与项目集成

yaml-cpp 跨平台编译指南:Windows、Linux、macOS 下的 CMake 配置、常见错误与项目集成 【免费下载链接】yaml-cpp A YAML parser and emitter in C 项目地址: https://gitcode.com/GitHub_Trending/ya/yaml-cpp yaml-cpp 是 C 编写的 YAML 解析与生成库&… · 2026/9/24 14:25:23

申晨亮相2026中国餐饮品牌节,解码后流量时代增长逻辑
申晨亮相2026中国餐饮品牌节,解码后流量时代增长逻辑

2026年9月21-23日,广州——在2026中国餐饮品牌节暨第36届HCC全球餐饮产业博览会期间,三三得久、熊猫传媒创始人申晨先后亮相品牌大会主论坛与私享会,分别以《真实需求五步法:从“用户想吃什么”走到“这门生意能不能成立”》和《营… · 2026/9/24 14:25:23

电子课本下载工具 tchMaterial-parser:粘贴预览页网址,一键下载平台 PDF 教材
电子课本下载工具 tchMaterial-parser:粘贴预览页网址,一键下载平台 PDF 教材

电子课本下载工具 tchMaterial-parser:粘贴预览页网址,一键下载平台 PDF 教材 【免费下载链接】tchMaterial-parser 国家中小学智慧教育平台 电子课本下载工具,帮助您从智慧教育平台中获取电子课本的 PDF 文件网址并进行下载,让您… · 2026/9/24 14:25:17

基于YOLOv8的渔船作业监控系统:从环境搭建到边缘部署全流程
基于YOLOv8的渔船作业监控系统:从环境搭建到边缘部署全流程

简介:这是一套面向计算机、人工智能、自动化等专业学生与教师的毕业设计级项目资源,围绕YOLOv8实现渔船作业监控系统,可用于毕设、课程设计、大作业或项目立项演示。压缩包共97个文件,约24.21MB,以70个Python源码文件为… · 2026/9/24 0:00:13

1D-CNN时间序列建模实战:从Conv1d原理到工业落地
1D-CNN时间序列建模实战:从Conv1d原理到工业落地

简介:面向时间序列数据建模的一维卷积神经网络完整实现,适合深度学习入门者及需要快速验证时序模型的研究者,能够从音频、文本、传感器或股价等序列中挖掘局部特征与时间依赖。压缩包体积很小,只有3KB,内含3个Python脚… · 2026/9/24 0:00:26

柔软的L:汉语语流中被忽视的舌肌张力控制
柔软的L:汉语语流中被忽视的舌肌张力控制

1. 这个“L”不是字母表里的L,而是舌尖上的L最近在几个方言群和语音教学社群里,反复看到有人发一句:“也说字母L:柔软的长舌”。初看以为是英语发音课笔记,点开才发现全是方言爱好者、播音系学生、语言康复师甚至戏曲演… · 2026/9/24 0:00:44

了解更多?预约专属演示

我们的顾问将为您一对一讲解产品与方案

企业微信二维码