关于本站
本站为个人技术记录站点,用于整理与沉淀后台开发方案的设计、实施与持续改进经验,并调研自然语言处理(NLP)、强化学习(RL)等前沿算法在实际工程中的应用方法与实践体会,同时记录简单分类的学习计划。
一、后台开发方案实践与改进
1. 服务架构与网关
- 反向代理与负载均衡方案(Nginx / OpenResty)的选型与配置实践。
- 基于 TLS 的访问控制与安全加固实践。
2. 自动化运维与部署
- 使用 Shell / Python 脚本实现多服务器批量部署、配置同步与定时任务。
- 证书的自动申请、续期与多节点分发流程建设。
- 服务自愈:健康检查、失败重试与重启策略的实践与改进。
3. 监控、日志与安全
- 访问日志与错误日志的分析方法,常见故障的定位流程。
- 防火墙、端口开放策略与登录安全加固实践。
- 问题-定位-修复-文档化的闭环改进经验。
二、自然语言处理(NLP)前沿算法应用调研
1. 预训练语言模型
- Transformer 架构与 BERT / GPT 系列模型的发展脉络与选型调研。
- LoRA / QLoRA 等高效微调方法在垂直场景下的实践与改进。
2. 大模型应用工程
- 检索增强生成(RAG):Embedding 选型、向量检索、重排序的工程化实践。
- Prompt 工程与 Function Calling,多轮 Agent 工具调用流程的设计经验。
- 长文本切分策略、检索质量评估,以及成本与延迟优化(模型路由、缓存)的改进体会。
三、强化学习(RL)前沿算法应用调研
1. 算法基础
- 马尔可夫决策过程(MDP)与 DQN、PPO、SAC 等主流算法的调研与比较。
- 状态空间、动作空间与奖励函数设计对训练效果的影响。
2. 与大模型的结合
- RLHF / DPO / GRPO 等对齐技术的原理调研与实际应用方法。
3. 应用场景探索
- 资源调度、自动调参、网络流量优化等场景下的应用调研。
- 训练稳定性、样本效率与奖励塑形的实践改进经验。
四、学习计划(简单分类)
| 分类 | 阶段 | 学习内容 | 参考资源 |
|---|---|---|---|
| 基础理论 | 第 1-3 周 | 线性代数、概率统计、信息论基础 | 公开课与经典教材 |
| 第 4-6 周 | 机器学习基础:监督 / 无监督 / 评估方法 | 机器学习相关公开课程 | |
| 后台工程 | 第 7-9 周 | Linux 与网络基础、Nginx 与网关实践 | 官方文档 + 实验环境 |
| 第 10-12 周 | 容器化部署、监控告警与自动化运维 | Docker 文档 + 实战项目 | |
| 自然语言处理 | 第 13-15 周 | 词向量 → Transformer → 预训练模型原理 | 相关论文与课程笔记 |
| 第 16-18 周 | 微调实践、RAG 与 Agent 应用开发 | 开源框架 + 动手项目 | |
| 强化学习 | 第 19-21 周 | MDP 与 DQN / PPO / SAC 算法实践 | 强化学习公开课 + 环境实验 |
| 第 22-24 周 | RLHF / DPO 对齐技术与领域应用调研 | 论文精读 + 小型实验 |