golang进程内存控制避免docker内oom

背景

golang版本：1.16

之前遇到的问题，docker启动时禁用了oom-kill（kill后服务受损太大），导致golang内存使用接近docker上限后，进程会hang住，不响应任何请求，debug工具也无法attatch。

前文分析见：golang进程在docker中OOM后hang住问题

本文主要尝试给出解决方案

测试程序代码如下，协程h.allocate每秒检查内存是否达到800MB，未达到则申请内存，协程h.clear每秒检查内存是否超过800MB的80%，超过则释放掉超出部分，模拟通常的业务程序频繁进行内存申请和释放的逻辑。程序通过http请求127.0.0.1:6060触发开始执行方便debug。

--memory 1G --memory-reservation 1G --oom-kill-disable=true

bash: fork: Cannot allocate memory

之前的分析中，hang住的地方是调用mmap，golang内的堆栈是gc stw后的mark阶段，所以最开始的解决方法是想在stw之前预留100MB空间，stw后释放该部分空间给操作系统，改动如下：

但是进程同样会hang住，debug单步调试发现存在三种情况

可见，预留内存的方式只能对第3种情况有改善，增加了预留内存后多数为第2种情况阻塞。

从解决问题的角度看，预留内存，是让gc去适配内存达到上限后系统调用阻塞的情况，对于其他情况gc反而更差了，因为有额外的内存和cpu开销。更何况因为第2种情况的存在，导致gc的修改无法面面俱到。

而且即使第2种情况创建g不阻塞，创建g后仍然需要找到合适的m执行，但因为已有的m都会因为系统调用被阻塞，而创建新的m即新的线程，又会被阻塞在内存申请上。所以这是不光golang会遇到的问题，即使用其他语言写也会有这种问题。在这种环境下运行的进程，必须对自身的内存大小做严格控制。

通过第一种方案的尝试，我们需要转换角度，结合实际使用场景做适配，避免影响golang运行机制。限制条件主要有：

需要让进程控制内存上限，同时在达到上限前多触发gc。解决方式如下：

用内存池。测试程序中的allocate和clear的逻辑，实际上就是实现了一个内存池，控制总的内存在640~800MB之间波动。
增加gc频率。程序启动时加环境变量GOGC=12，控制gc步长在12%，例如内存池达到800MB时，会在800*112%=896MB时触发gc，避免内存达到1G上限。

实测进程内存在900MB以下波动，没有hang住。