0720碎碎念
星期一
想到可以找小姐姐看八仙过海,终于有合家欢电影可以看了,还有薯条!还有奥德赛可以看,不过我觉得这个没什么外国文化铺垫不好看
上火中,还是要吃清淡点外加运动
SDK的情况等已经落实到文档里面了,描述了系统情况,SDK版本,基于vCUDA的调度器,SDK如何里面包含的内容(不含vllm,但是有pytorch)等。SERVER_ENVIRONMENT.md
尝试在服务器上通过singbox翻墙。主要是让codex在上面跑通。(已经跑通,使用的tuic协议,只代理http、https,没有使用TUN,拉取镜像等需要额外配置比如使用添加前缀m.daocloud.io/docker.io/library/busybox)
模型部署这一块要求就是7B模型,能实现简单对话即可
另外语义分割之类的也需要,不过可以等其他同事
在研究完这个销毁速度以后,(通过修改模板里面的terminationGracePeriodSeconds字段实现,现在的保留时间是1秒)
以GPU模板为例,销毁pod的大致时间线是:
1. 0–0.029 秒:API 接到 DELETE,定位为独立 GPU Pod,向 Kubernetes 提交删
除;API 返回 204。
2. 随后:Kubernetes 给 Pod 标记 deletionTimestamp,所以 kubectl get pod
会显示 Terminating。
3. 约 1 秒:节点上的 kubelet/containerd 向容器的 PID 1 发送 SIGTERM。
SIGTERM 是“请正常退出”的 Linux 信号。正常业务程序会借此停止接收请求、
关闭连接、刷写缓冲区、保存 checkpoint 等。这个测试容器只是等待中的
shell/sleep,没有业务数据需要处理。
4. 到 1 秒宽限期结束:若容器仍未彻底退出,kubelet 会用 SIGKILL 强制结束剩
余进程。SIGKILL 不能被程序捕获或忽略。
5. 剩余约 3.7 秒:系统完成容器运行时、网络、cgroup、挂载和 GPU/vGPU 资源
的回收,并将最终状态同步回 API Server;之后 FastAPI 查询该 Pod 才返回
404。GPU 模板还可能涉及设备插件/vGPU 管理器释放资源,这部分比普通容器
多一些控制面处理。
因此,4.779 秒包含的是:
- DELETE API 请求与控制器处理;
- 1 秒终止宽限期;
- 容器与 GPU 资源回收;
- API Server 删除对象及轮询到 404 的时间。
它不代表该测试 Pod 做了 4.779 秒的数据清理。对这个没有业务任务的 GPU
Pod,真正“应用层清理”几乎为零。若目标是更低且更稳定的时间,瓶颈已主要转移
到 Kubernetes/容器运行时/vGPU 回收,而不只是
terminationGracePeriodSeconds。
立刻需要研究的是那个通信协议控制之类的内容
随后设置控制面板前端页面,使用最简单有效的方式,抓取已经有的API的内容。此处可以考虑安装普罗米修斯来获取各个节点的性能占用等数据,只是去掉浮夸的前端面板。
提升pod的销毁释放速度,这个在AI里面有解决方式,需要尝试做一下。
考虑在当前Prometheus + Grafana框架下,加入对GPU资源的监测。(这个是全平台监测,还额外需要pod级别的监测)
有点乱,需要总结一下
在AI帮助下以迅雷不及掩耳之势完成了前端,能拉起服务,能停止,能查看本地registry里面都有什么。
解决了5s以内销毁pod,满足时间约束
仍不完美的地方:资源监控面板和各个pod级别的GPU资源占用,节点级别的可以使用当前酷炫的面板。好的已经有了,并且随时间变化的就放在那个prometheus组合里面去看吧,够炫酷了
接下来是那些所谓的核心网控制的代码之类的内容——什么控制面和核心网全都看不懂思密达,路由算法可以实现一个迪杰斯特拉,但是我不知道这种东西怎么算容器部署。
然后vllm看一下部署一个7B对话的大模型上去,然后加入这一套。
脑袋有点爆炸,现在是一个人,走通了全套的k8s组件部署、镜像制作,SDK引入,python包导入,pip包依赖冲突解决。然后解决了FastAPI制作的统一管理后台,解决了前端布局和调用,解决了prometheus+grafana+node explorer显示各个节点的系统资源情况,解决了codex使用,claude code使用(调用deepseek API),sing-box的安装,配置上网环境,使用openai原生模型,配置全自动以及合理的思考强度。修改了systemd,配置开机启动,配置良好的restart控制命令。创建普通容器模板。
信息量太大,有点太复杂了,我感觉已经爆炸了。
休息了一下,感觉已经全落盘好了,在md里面信息量已经比较大了
上周就周一周二练了两天,然后周末也没练。
自己可能需要一双新运动鞋。泡水了的运动鞋穿起来太难受了(今天又重新拿出来穿了)
星期二
今天股票行情可以说是很重要了,考虑弄一个小玩意实时显示股票,可以考虑那种随身WiFi棒子。给茜姐送一个
好真离谱,九点半才开盘。股市腰斩,有点东西,你不能只有赚钱的时候才高兴。老登股看起来都涨了,真是有意思,希望这些人学费交够了以后真能赚钱吧。看看A股得真有正常的资本市场。
今天的训练是有氧,然后做些小项的训练。
今天工作的主线是自己理解一下前端的代码,然后改改图片和显示之类的。
还有就是部署大模型
说实话我有点不知所措,算法怎么装在容器里面?至少有个前端的页面才有用吧。弄个dijkstra算法网页自己弄一下就行
这kubectl exec -it还能一键进入备份是咋回事,真能一键保持状态?
复现师姐的论文相关内容,作为后端算法备选。(可能需要项目重构,让这些算法更好暴露接口)
看一下最简单的harness框架 pi搭配插件oh-my-pi
八月份还有高温假,笑死。还挺好(给那边写了表格,交上去了)
电话给我打的有点不知所措了
好了中午吃烤鱼,这饭吃的是一顿更比一顿猛了,还是要多多运动,哎,才能把这些都保持下来
好热,现在是时候做点我自己的事情了,感觉终于消停下来了
每天下班都去健身房,这就是一种我的生活,我要在这种状态下才能感受自我存在的真实。
似乎可以ix-exporter组件,把系统计算卡的信息抓出来,然后放在炫酷的界面上
星期三
修改前端和API定义,创建带有AI框架的pod,要能有地方更改挂载,而且要能有多个挂载目录和目的地。默认选项里面要内置显示默认的挂载目录地址
k8s是每个pod都有分配的ip 吗?我以为是node层级的
我是不是可以玩玩我的A770搞点本地大模型部署?有意思,显存!弄点电子鹦鹉,或者作为某种低成本使用。
搞一下更集群化的配置,比如PVC,对于在haiyue上运行的服务的持久化数据,都用PVC挂载,只有这个节点上的是使用hostPath本地,并且指定pod必须运行在当前节点上。即,分布式存储这一块。rustFS是什么东西
搞点轻松的吧,比如引入ix-exporter,然后整合到炫酷的面板里面。
考虑搞一下playwright自动测试前端,这样我就可以舒服多了(x,就可以完成全流程的测试了,因为还有本地的API以及前端的相关实现。
似乎现在人脑才是那个最容易到达极限的瓶颈。前一个任务产出的文档还没有仔细查看,后一个任务又完成了。
后边还需要继续的是 DeepSparkHub里面的一些yolo、语义分割的其他的模型,一样部署进去。然后下周要集中一下做潘少的任务,做全球覆盖的分析,做目标区域覆盖的分析,看一下他发过来的两篇论文还有专利的实现方式。
本周的话结束一下这个云部署相关的内容吧,基本差不多了,明天收尾一下pod迁移,新节点的接入等等工作,还有PVC、分布式存储等相关的配置。
调研一下oh-my-pi这样的工具
了解了范堡罗航展,还有文身会RIAT 航展(每年一次)。这种还是比国内珠海航展要好太多了。但是国内的珠海,在今年应该还是很好的,时间延后到12月了,天气会很好。可以尽量早拿上长焦镜头,以及定酒店。还可以继续住在广州。
在AA上对比chatgpt新的三个模型
在AA上对比qwen开源模型的能力水平
在AA上继续了解一下kimi k3的能力水平
总结一下相关的内容。
量化的分类,版本,和内核的关系
Qwen的系列,vllm的版本与模型注册的关系,及其重要性。
还搞上了tmux,选择良好的配置,现在服务器上的东西也是越来越多了(今天还加上了UV,在非vs code环境里面只能自己激活虚拟环境了,使用命令source .venv/bin/activate,关闭则使用deactivate)(其实uv可以有两个层面,uv add配置修改toml的是项目层次的,这样很方便别人一键同步安装,也有一个层面是直接进入虚拟环境然后uvuv pip install numpy pandas,这和python管理venv没区别。)。主要配置项是256色,超大历史缓存。使用的方式就是tmux new -s <name>,离开是ctl b+d,直接关闭是ctl b+x注意在tmux里面按ctl+d还是会导致EOF退出的。tmux有自己的控制逻辑,但是对于最朴素的用法——作为一个后台,保持coding agent的运行,还是太笨重了。所以窗口划分之类的都不用。然后常年只开一个窗口,恢复的时候tmux a就行了。用tmux ls可以查看现在一共开了多少个。另外不开启tmux的鼠标控制,直接自己用xshell的快捷键复制粘贴就行。
看了一下oh-my-pi,这是基于pi的衍生品。pi的思路是任何人都可以基于pi往上面搭积木,然后ship,自己打包发布自己的整合包,这就像加mod一样。
星期四
明天和周末三个事情:
周五上午约面试,压力不要过于大,差不多就可以走了,不过还是要准备打印的简历
两个测试,需要适当做一点行测题目,直接在网上做比较好。但是其实也无所谓。这个也周五做,周六下午会失效
周日前 随便做一下那个编程的网上测评
今天主要任务是落实一下文档,然后把云部署主要内容给交付一下
充电到20%然后去买早饭,鸡胸肉。考虑一下鸡胸肉长期食用的来源。真的好想自己做饭,每天的饮食支出有点太高了
考虑明天中午休息一下去吃拉蒂娜(有点安排不开,要不算了,吃点别的休闲一下,这个下周再说),所以今天要练腿最好是,可以考虑直接光脚上。当然了,还需要上称一下
好玩的:经济学追踪网站trading economy很有信息量,并且还有API接口,可以考虑接入或者做点硬件配套
解决一下这两个室都要的情况,我自己的想法是先来后到,就去控制室就挺好。遥感这边感觉硬件可能多一些,然后技术上弱一些,而且可能和地信等专业更接近一些。
省流,都是垃圾
笑死,找个人办进院,看看几点下班,问问他们薪资多少。笑死我了,然后还有年底大干400天
其实还是主要看营收,有没有项目,没有项目那屁都不是。
找找附近有没有主食厨房,或者买黄瓜之类的能生吃的玩意。天天中午土豆可能还是有点逆天了,还是油炸薯条
学习一下k8s的网络和向外端口映射,好像也稍微复杂一点。测试别用黑框框了,直接用podman吧,直接GET,然后curl那种测试和POST好像实际上是一回事?
买新衣服,约小姐姐看电影、逛街,买东西。棉麻材质,不起球
买水果吃,苹果
正在了解HTTPS,公司电脑监管,局域网防火墙概念(家庭和公共场所范围),以及校园网内网是否算局域网可以互联(不能互联的原因等)
DNS泄露、公司网关查看我的访问地址(通过DNS解密)
公司,校园网通过10.开头和家庭通过192.开头,有什么区别?
k8s系统,现在只是完成了多个节点的配置,部署deployment创建多个pod,好像只有备份的作用,具体业务如何实现好像还需要进一步的开发。另外现在这个前端好像没法显示服务端口。(镜像里面运行在什么端口上,这很重要,必须手动指定。就相当于在手动写docker部署时候的端口映射,容器里面监听和外面实际访问的端口要做映射)
了解一下codex跨文件夹的修改。(同级文件夹)这个时候agent的读取和遵循会怎样。
补充若干k3s的基础知识,包括网络设置、CNI、网络层级,尤其是和应用最相关的端口映射。k8s里面开service又是什么意思?
开始了解资源池化和k8s集群并行计算的相关概念,目前来看是job搭配ray(或其他的分布式计算框架),把任务切分成worker,然后分到各个pod里面去运行。
等下周来了,把大模型部署相关的内容再手动操作一下然后用postman测一下。