首页/新闻资讯/正文详情

服务器 free 只剩 200MB,为什么它一点事没有

发布时间:2026/9/23 7:54:20 来源:云帆数科 栏目:资讯中心
服务器 free 只剩 200MB,为什么它一点事没有
监控群里昨天又炸了一次。“XX 服务内存告警free 只剩 200MB”运维同学半夜爬起来登上去敲了free -h看了一眼回群里丢了句“没事正常别慌。”新来的同学不理解200MB 也叫正常这就是 Linux 内存管理最容易被误读的地方。而且更要命的是——很多公司监控面板上的内存使用率公式本身就是错的。free 的输出只有一列值得看total used free shared buff/cache available Mem: 62Gi 18Gi 200Mi 1.2Gi 44Gi 41Gi大部分人盯着free那一列看然后开始慌。但真正决定这台机器还能不能再接活的是最后一列available。关系是这样的available ≈ free 可回收的 buff/cacheLinux 的设计哲学是空闲内存是浪费。只要还有空内存内核就拿它去缓存磁盘数据page cache因为磁盘比内存慢好几个数量级。这些缓存不是被占用了是被借用了——一旦应用要内存内核可以立刻回收还给应用。所以free只有 200MB 完全可能毫无压力available有 41Gi 才是真相。这也顺带解释了为什么内存用了 70%的服务器跑得好好的那 70% 里绝大部分是 page cache。你的监控公式可能是错的这条是我见过最普遍的问题。很多老的监控脚本、自研的采集插件内存使用率是这么算的# 错误写法used_percent(total -free)/ total *100在free200MB / total62GB的机器上这个公式会告诉你使用率99.7%然后疯狂告警。而实际上这台机器一点事没有。正确写法只有一种# 正确available 才是应用真正能拿到的内存used_percent(total - available)/ total *100或者直接读/proc/meminfogrep-E(MemTotal|MemAvailable|Buffers|Cached|Dirty|Slab)/proc/meminfo看一眼你的告警规则。如果表达式里出现的是node_memory_MemFree_bytes那你的告警大概率一直在误报正确的是node_memory_MemAvailable_bytes-alert:HighMemoryPressureexpr:(node_memory_MemTotal_bytes-node_memory_MemAvailable_bytes) / node_memory_MemTotal_bytes0.85for:5mdrop_caches千万别在生产上敲搜Linux 清理内存第一条永远是echo3/proc/sys/vm/drop_caches看着很爽free立刻给你回一大截。但这个动作的实质是把磁盘缓存全丢掉逼系统接下来重新从磁盘读一遍。后果是接下来一段时间磁盘 I/O 飙升、所有服务响应变慢。你在生产上敲这一行等于主动给自己制造一次性能事故。内核自己会回收不需要你手动掺和。这条命令的正确使用场景只有一个跑基准测试时想要可复现的冷启动环境。那什么时候才是真的危险不是free少而是回收开始跟不上分配。判断信号看这几个一、vmstat里的si/so持续不为 0。vmstat2# si: 每秒从 swap 换入的 KB so: 每秒换出的 KBsi/so一直是 0说明没有换页压力。一旦持续有值就是在拿磁盘当内存用了,应用响应会明显劣化。二、Direct Reclaim。内核有个后台线程kswapd负责提前回收内存。当分配速度超过它回收的速度分配内存的进程自己被迫停下来同步回收——这就是 Direct Reclaim表现是莫名其妙的卡顿长尾。用 eBPF 抓vmscan相关事件能直接看到。三、OOM Killer 日志。这是最后的兜底dmesg|grep-ikilled process看到Out of memory: Killed process 12345 (java)才是真正的内存不足——和free数字大小没关系。保护关键进程oom_score_adjOOM Killer 挑人下手是按oom_score打分的分越高越先被杀。而打分的一个主要权重就是进程占了多少内存——这意味着吃内存最多的数据库往往是最先被杀的。# 看某个进程的分数cat/proc/$(pidof mysqld)/oom_score# 保护它分数范围 -1000永不被杀到 1000echo-500/proc/$(pidof mysqld)/oom_score_adjsystemd 服务可以直接写进单元文件[Service] MemoryMax4G MemoryHigh3G OOMScoreAdjust-500注意MemoryMax和MemoryHigh是 cgroup v2 的MemoryHigh是软限制超过就开始回收但还能用MemoryMax是硬限制超过就直接杀。用MemoryHigh做缓冲比直接撞MemoryMax温和得多。一个反常识的参数THP 该关透明大页Transparent Huge Pages默认是开的cat/sys/kernel/mm/transparent_hugepage/enabled# [always] madvise never它的好处是减少 TLB 缺失对通用负载Web 服务、文件服务确实有收益。但对延迟敏感的数据库建议关掉或改成madviseechomadvise/sys/kernel/mm/transparent_hugepage/enabled原因在后台守护进程khugepaged——它会频繁扫描并合并小页导致不可预测的 CPU 峰值和内存锁竞争在 MySQL、PostgreSQL、Redis、Elasticsearch 这类场景下表现为查询延迟的微秒到毫秒级抖动。内存碎片严重时THP 还可能触发激进的 Direct Compaction直接造成服务超时。常用参数速查参数作用建议vm.swappiness倾向回收匿名页还是文件页数据库/缓存 010通用 60默认vm.dirty_ratio进程自己开始回写脏页的阈值写敏感调低如 510减少 I/O 抖动vm.dirty_background_ratio后台回写启动阈值通常 5vm.vfs_cache_pressure回收 dentry/inode 的积极程度读多写少降到 50内存紧张提到 200vm.overcommit_memory内存超额分配策略Redis 要设 1避免 fork 失败再补一条冷知识跑 Redis 一定要设vm.overcommit_memory1。不设的话主从同步时的 fork 可能直接失败日志里只有一句含糊的报错查半天查不出来。最后把这篇压缩成三句话看available不看free。你的告警公式最好现在就去改。drop_caches不是运维命令是压测工具。生产上敲它等于自残。内存不足的证据是 Direct Reclaim 和 OOM 日志不是free的小数字。Linux 的内存管理设计得相当聪明——它在努力让你的磁盘访问变快而不是在偷偷占你的内存。先理解它在帮你再决定要不要打断它。

相关推荐

FPGA物理实现层实战指南:跨时钟域、IO约束与定点数避坑
FPGA物理实现层实战指南:跨时钟域、IO约束与定点数避坑

1. 项目概述:这不是一个“问答平台”,而是一份FPGA工程师的实战备忘录“FPGA问答上”——看到这个标题,别急着点开网页或下载APP。它根本不是什么新上线的社区产品,也不是某个厂商推出的在线答疑系统。这四个字,是我在… · 2026/9/23 7:54:19

Atlas 300I 驱动安装避坑指南:为何 Ubuntu 20.04 翻车而 18.04 稳如磐石
Atlas 300I 驱动安装避坑指南:为何 Ubuntu 20.04 翻车而 18.04 稳如磐石

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views … · 2026/9/23 7:54:13

嵌入式C++在STM32上的实战:打破“跑不动”的刻板印象
嵌入式C++在STM32上的实战:打破“跑不动”的刻板印象

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views … · 2026/9/23 7:54:13

有效数字的定义入门到精通
有效数字的定义入门到精通

3步吃透有效数字定义,从入门到精通避开精度坑 你是不是也遇到过这种情况:看了一堆关于浮点数精度的教程,觉得道理都懂,结果一写项目就翻车。 0.1 + 0.2 !== 0.3… · 2026/9/23 9:17:31

【Oracle】存储过程 cursor 循环中的 Exit、Continue、Return:TaoToken 统一 Key 下的调试配置骨架
【Oracle】存储过程 cursor 循环中的 Exit、Continue、Return:TaoToken 统一 Key 下的调试配置骨架

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views … · 2026/9/23 9:17:19

程序员必备AI技能:从基础到实战转型指南
程序员必备AI技能:从基础到实战转型指南

1. 行业现状与趋势分析2023年全球科技就业市场出现了一个显著的分水岭:传统编程岗位需求增长放缓至8.7%的同时,AI相关岗位却实现了215.61%的爆炸式增长。这个数据来自LinkedIn最新发布的《全球科技人才趋势报告》,它清晰地揭示了一个事实——… · 2026/9/23 9:17:12

变形金刚怎么画保姆级教程解决代码不会写痛点
变形金刚怎么画保姆级教程解决代码不会写痛点

变形金刚怎么画保姆级教程解决代码不会写痛点 刚接手新项目,对着需求文档发呆?看了一堆教程还是不会写项目,这是大多数开发者的真实写照。别慌,今天这篇 保姆级教程 ,带你用 Python 从零搭建一个“变形金刚”图形生成工具。… · 2026/9/23 9:17:06

a开头证书避坑指南:3个实操案例讲透变更注销全流程
a开头证书避坑指南:3个实操案例讲透变更注销全流程

a开头证书避坑指南:3个实操案例讲透变更注销全流程 面试被问原理答不上来,这种尴尬谁没经历过?尤其是面对“a开头”这类高频考点,很多人背了一堆条文,一到现场就懵。 这篇 避坑指南 ,不聊虚的。 结合我在一线带项目的经验,以及 掘金技术社区… · 2026/9/23 9:17:06

Atlas 300V 24G推理卡YOLO部署全流程:环境搭建、模型转换与踩坑指南
Atlas 300V 24G推理卡YOLO部署全流程:环境搭建、模型转换与踩坑指南

说实话,最一开始拿到这块卡的时候,我也被"24G"这个数字带偏过。同事说配了一块 24G 的推理加速卡,我第一反应是"那显存还挺大的,跑个大模型没问题"。等真正插上服务器,装驱动、配环境、转模型、跑… · 2026/9/23 9:17:06

3招搞定手机怎么下载微信面试难题实战项目解析
3招搞定手机怎么下载微信面试难题实战项目解析

3招搞定手机怎么下载微信面试难题实战项目解析 面试被问“手机怎么下载微信”背后的原理,90%的人答不上来。别笑,这看似弱智的问题,实则是考察你对移动应用分发机制、安全校验及网络协议理解的试金石。我带过不少校招新人,他们背了八股文,却连一个A… · 2026/9/23 0:00:03

你有新短消息请注意查收:3个新手避坑指南搞定消息系统选型
你有新短消息请注意查收:3个新手避坑指南搞定消息系统选型

你有新短消息请注意查收:3个新手避坑指南搞定消息系统选型 面试被问“高并发下如何保证消息不丢失”,你张口就是“用Redis”,结果面试官追问“如果Redis宕机了怎么办”,你瞬间卡壳。这种场景太常见了,很多新手在背八股文时,只记住了技术名词… · 2026/9/23 0:00:29

Win7无线热点配置工具源码解析:解决API失效的3个实战技巧
Win7无线热点配置工具源码解析:解决API失效的3个实战技巧

Win7无线热点配置工具源码解析:解决API失效的3个实战技巧 Win7无线热点配置工具在Win10/11上跑不动?不是你的问题,是版本升级后 API 全变了。很多老项目里的 netsh wlan… · 2026/9/23 0:00:36

了解更多?预约专属演示

我们的顾问将为您一对一讲解产品与方案

企业微信二维码