腾讯云智能顾问
游戏行业架构治理新范式
主讲人:腾讯云智能顾问产品负责人
futureliu(刘庆兴)
目录
1. 智能顾问助力客户用好云平台全景图
2. 游戏行业治理场景和效果分享
3. CloudQ –全球首款“领域虾”发布
01. 智能顾问 产品全景图
全球首款可视化AI架构治理平台
智能顾问:卓越架构治理
LightClaw 其他龙虾
IM-接入agent
微信 企业微信 Slack
Teams 钉钉 飞书
WhatsApp Line
CloudQ :首款ITOM“领域
虾”
龙虾-接入skill
WorkBuddy QClaw
多云纳管
腾讯云 AWS 阿里云 Azure GCP 其他云...
容灾演练
容量规划
重保护航
运营端协同
…
可视化|智能化|生态互联 腾讯云专家运营端协同治理
风险巡检
W+客户已形成卓越架构治理习惯
以架构图为核心上下文,释放AI云上治理实战价值
上下文
C o n t e x t
节点&
架构图
S t at e
数字资产
Me mo r y
智能生成
演练方案
AI - P o w e r e d
c h a o s p l a n
g e n e r a t i o n.
水位异常
根因分析
I n t e l l i g e n t
r o o t c a us e
a n a l y s i s .
智能护航
播报
S m a r t
b r o a d c a s t .
零代码生
成大屏
AI - p o w e r e d ,
no - c o d e
d a s h b o a r d
c r e a t i o n .
02. 游戏行业治理场景和效果
架构梳理/风险发现/容量管理和多云纳管
游戏运维面临的 6 大核心挑战
每一个都可能让 CTO 深夜被叫醒 —— 卓越架构六大支柱维度
性能效率
CTO高关注
开服洪峰扛不住,延迟飙升,
玩家3秒内未进入即流失
安全合规
出海必备
配置漂移导致漏洞暴露,
全球合规差异大
可靠性
运维核心
MTTR 15+分钟,
多个控制台轮番切换
成本优化
CFO关注
资源分配不合理,
容量规划全凭经验
卓越运营
效率瓶颈
200+微服务依赖一团麻,
SRE人才招聘难
可持续性
长线挑战
架构技术债越积越多,
技术演进跟不上业务
Before:传统的资源清单
# 资源名称 类型 状态 数量
1 game-server-prod-01 ECS 运行中 48
2 game-db-master MySQL 运行中 6
3 redis-cluster-01 Redis 运行中 12
4 Pod 运行中 237
5 msg-queue-prod MQ 运行中 4
6 cdn-distribution CDN 运行中 3
7 load-balancer-prod CLB 运行中 8
8 cos-bucket-assets COS 运行中 5
game-pod-deploy
... 还有 320+ 条资源
只有清单,没有架构、没有层次、没有关系
After:6 层架构
L1
业务/领域层
TPS · MOBA · RPG · SLG · 休闲
▼ MOBA ▸
L2
软件系统层
A 游戏 · B 游戏 · C 游戏
▼ A 游戏 ▸
L3
应用/服务层
云服务器 · 云数据库 · COS · CDN
▼ 云服务器 ▸
L4
实例层
实例-1 · 实例-2 · ... · 实例-5
▼ 实例-1 ▸
L5
模块/组件层
如 OpenClaw,部署在云服务器/容器服务中
▼ OpenClaw ▸
L6
代码/脚本层
如 SKILL,实现模块/组件的源代码
层层可下钻,从业务一直穿透到代码
从“看清单”到“看架构”
6层架构,看清资源关系与依赖
游戏开服及大版本更新 — 重保护航
CTO 核心关注:怎样让每一次开服都从容不迫?
治理前
开服10分钟社群爆发「卡顿」投诉
运维在5个监控控制台间疯狂切换
故障定位平均耗时 15+ 分钟
手动扩容沟通→审批→操作 30分钟
容量全凭经验猜测,常常不够或浪费
→
一TS图A看治全理局后,秒级定位
容量治理Agent自动预警+弹性扩
缩
MTTR 15分钟→3分钟,降低
80%
SKILL编排自动扩容,3分钟完成
多云统一视图,5套监控→1个平
台
80%
MTTR 降低
10x
弹性效率提升
60%
运维人力节省
0
版本上线事故
高可用建设 — 混沌演练 + 预案管理
运维负责人关注:如何从被动救火转向主动防御?
01
架构链路分析
可视化自动识别
单点故障与依赖风险
02
GameDay方案生成
混沌演练 Agent
一键生成 GameDay 方案
03
故障注入
130+ 故障原子能力
CVM/网络/DB 全覆盖
04
验证修复
量化评估治理成效
生成治理闭环报告
实战案例:某游戏企业新服上线压测+演练
方案设计
模拟高并发流量 + 多类故障场景注入+应用层稳态观测
演练场景
负载→压力→并发→全链路
治理效果
提前发现 3 类性能瓶颈,0 线上事故
7 / 12
成本优化 — 容量治理 + 资源右移
CTO + CFO 关注:如何在保障体验的前提下降本增效?
成本黑洞,资源配置不合理
非活跃期资源闲置率高达 60%
容量规划全凭历史经验,无数据支撑
跨云账单分散,成本黑洞不可见
人工扩缩容响应慢,错失最佳时机
→
TSA 方案
容量治理实时监测资源负载水位
容量预测Agent智能分析需求曲线
多云统一成本视图,精准定位浪费
SKILL编排自动弹性,按需伸缩
某棋牌平台
40%
年云费用节省
多云纳管 + 自动弹性
某 FPS 竞技
0
资源浪费
自动扩容替代人工操作
某休闲游戏
30%
运维成本降低
参考阿维塔实践数据
客户故事:「全栈治理者」如何使用智能顾问
游戏行业客户案例
游戏行业客户案例
更多客户案例,沉淀为游戏行业最佳实践
1 某头部 MMORPG:故障 MTTR 从 15 分钟降至 3 分钟
2 某 SLG 出海大作:5 套监控统一为 1 个可视化平台
3 某 FPS 竞技游戏:自动扩容替代人工,多云资源零浪费
4 某休闲游戏工作室:SKILL 编排实现全自动故障自愈
5 某二次元手游:全链路可观测覆盖,版本上线零事故
6 某开放世界端游:架构治理 6 层穿透,定位提速 10 倍
7 某棋牌平台:多云纳管 + 成本优化,年省 40% 云费用
TSA卓越架构治理:
游戏行业技术支持
白皮书
腾讯云技术支持团队 & TSA 官方出品
完整接入指南
游戏运维最佳实践\行业标杆案例集
请联系腾讯云侧接口人获取
4月上线国际站,助力全球化出海更稳
CTO 关注:新加坡、硅谷、韩国都有服务器,如何统一管理?
统一数据接入
不同云厂商的指标、日志、链路数据
统一采集与标准化,打破数据孤岛
统一可视化面板
一个控制台看清全部云资源,跨地域
架构拓扑全貌一目了然
统一治理策略
告警规则、SKILL编排、合规策略跨
云统一配置,自动同步生效
03.全球首款ITOM“领域
虾”
随时随地治理云,Just Q IT !
CloudQ : 一个龙虾管好多云
直连微信、QQ、飞书、钉钉、Slack等IM,
Q 一下掌握架构最新动态,治理报告一句话导出
Workbuddy、codebuddy等IDE
一键安装Skill,丝滑嵌入工作流
10 / 12
CloudQ — Just Q IT !
运维工程师
业务负责人
管理者
…
CloudQ
通过CloudQ实时协同治理,保障新游戏顺利上线
专业服务只为助力客户用好云!
立即使用 TSA
开通试用环境
体验全栈可视化
当前服务免费
获取白皮书
卓 越 架 构 治 理 白 皮 书
生 成 式 AI治 理 白 皮 书
游戏行业最佳实践
加入SKILL市场
共 建 运 维 自 动 化 生 态
让 SKILL帮 你 值 夜 班
OpenClaw开放接入
体验 CloudQ
全渠道ChatOps
一只Q管多云
Just Q IT!
扫码加群
即刻将CloudQ 嵌入你的云管理平台
谢谢观看
扫码体验TSA
202
6
大模型时代AIOPS技术变革
分享人:刘伟 腾讯云华东游戏架构师
�录
CONTENTS
AI驱动需求管理
智能需求分析与自动化拆解
AI智能开发
代码生成、审查与智能辅助
AI驱动发布变更
智能风险评估与自动化部署
AI驱动故障处理
根因分析、自愈与智能告警
FinOps+AI精细化成本控
制
资源优化与智能成本预测
未来趋势与技术前瞻
大模型演进与下一代运维架构
引�:�模型重构研发运维
�模型正经历从“辅助�具”向“核��产�”的跨越式进化,
通过五�技术范式,深度重构研发运维的全链路流程。
RAG 检索增
强
打破�模型知识边界,融合企业私有知识库与实时运
维数据,提供精准、上下�感知的智能问答与故障诊
断能�。
Function
Calling
赋予�模型“动�”能�,�缝对接现有运维�具链与 API
接�,实现从“给出建议”到“�动执�”的闭环操 作。
MCP 协
议
标准化�模型与外部�具的通信协议,实现自然语�
到运维操作的�缝转换,将15-20步��流程封装为统
�API接�。
Skills 技能封
装
将运维领域专业知识封装为可复�的技能模块,�持
动态加载与组合调�,实现运维能�的标准化与规模
化复制。
Multi-Agent 协
同
构建多智能体协作�络,模拟�类专家团队,在复杂
故障排查、架构设计等场景中实现自主规划、分�与
协作。
全链路总览图
AI-DRIVEN FULL LIFECYCLE
OVERVIEW
核心价值: 大模型技术深度融入软件�程全生命周期,实现从被动响应到主动预测的智能化跃迁
0
1
需求分析
REQUIREMEN
T
智能需求解析与拆解
PRD文档自动生
成 需求冲突智能
检测 历史相似需
求推荐
0
2
智能开发
DEVELOPMEN
T
Copilot代码智能补
全
单元测试自动生成
代码规范智能审查
遗留代码重构建议
0
3
持续发布
DEPLOYMENT
变更风险智能评估
自动化灰度发布策略
发布异常实时熔断
版本依赖智能分析
0
4
故障�愈
INCIDENT
海量告警智能降噪
多维指标异常检测
根因定位与拓扑分析
预案推荐与自动执�
0
5
成本优化
COST
资源利�率精准画像
闲置资源智能回收
容量预测与弹性伸缩
云账单异常波动分析
传统痛点与AI解决�案对�
传统需求管理痛点
1
描述模糊与歧义
需求�档缺乏统一标准,自然语�描述常存在语义歧
义,导致开发与测试�员理解偏差,沟通成本�昂。
2
边界与异常缺失
��编写极易遗漏异常场景、�功能性需求及系统边界
条件,导致系统健壮性难以在设计初期得到保障。
3
�险识别严重后置
逻辑漏洞与架构冲突往往在测试甚�上线阶段才暴露,
此时修复成本呈指数级上升,严重影响交付周期。
AI 智能解决�案
结构化解析与智能补全
�模型�动解析�结构化需求�本,提取关键实体与业 务
逻辑,并基于知识库智能补全缺失的边界条件与异常
处理分�。
�险前置识别与拦截
在需求阶段即进�逻辑冲突检测、系统依赖分析与安全
合规扫描,将潜在风险拦截在开发之前,实现真正
的"左移"。
�动化评审与�例生成
�动生成多维度的评审意�报告,并同步输出测试�例
草案,�幅提升需求评审的效率与最终交付质量。
AI四层能�体系
从基础质量保障到完全自动执�的智能化演进路径
L
1
质量保障
Prompt + 规则引
擎
L
2
风险识别
Multi-Agent +
RAG
L
3
�例�成
LLM + 原�映射
L
4
�动执�
全链路闭环
AI REVIEW
ARCHITECTUREAI双层评审流
程
Intelligent R&D
Pipeline
双层智能评审机制 知识库精准瘦身策略
L
1
需求评审 (Requirement Review)
基于大模型深度解析PRD文档,自动识别逻辑冲突、边界条件遗漏及
非
功能性需求缺失。构建需求知识图谱,确保源头设计的完整性。
L
2
技术方案评审 (Tech Design Review)
对齐企业架构规范与历史最佳实践,自动评估技术选型合理性、系统扩展
性及潜在性能瓶颈。输出结构化评审报告与优化建议。
高价值数据提纯
剔除冗余历史版本,提取核心架构决策与�频故障根因,构建�质量向量索引。
动态上下文截断
基于语义相关性动态计算Token窗口,在保证上下文完整性的同时降低推理成本。
分级检索架构
实现"元数据过滤 + 稠密向量检索 + 重排序"的三段式架构,检索准确率提升�95%以上。
评审效率提升
倍
跨团队沟通成本
↓ %
三代范式演进
对话驱动
通过自然语�交互生成代码�段,
解决特定逻辑问题与代码解释。
终极形态
规约是唯�真理,代码是�成物
代码补全
基于上下�的单�或多�代码预测 与
补全,提升基础编码效率。
Ai Copilot
Spec Coding
规约驱动的系统级生成,实现从需
求到可执�代码的端到端自动化。
Spec Coding
Vibe Coding
Spec Coding 核��作
流重塑研发范式,实现从需求到代码的�缝转化
持久化上下文
确保全链路信息不丢失,AI理解更精准
验收驱动测试一体化
Spec即测试,代码生成与验证同步完
成
STEP
01
编写
Spec
10 - 20 分钟
结构化定义需求与验收标准
明确输入输出与边界条件
建立机器可读的契约
STEP
02
制定 Plan
架构设计与拆解
AI辅助生成技术实现路径
模块化任务拆解与依赖分析
评估风险与资源分配
STEP
03
�成 Code
自动化编码与验证
基于Plan自动生成业务代
码 同步生成单元测试�
例 持续集成与自动化验
收
Spec-Kit 三�件体系
STANDARDIZED SPECIFICATION FRAMEWORK
STEP 01
Given/When/Then 验收标
准
采用行为驱动开发 (BDD) 范式,通过标准化的
Given/When/Then 结构,精确定义业务场景与验收
条件。消除自然语�歧义,为 AI 编码提供确定性的目
标输入。
Given:
When
:
Then:
初始状态
触发动作
预期结果
STEP 02
d
系统架构护栏
确立系统边界、接口契约与技术规范。作为 AI 生成代
码的"架构护栏",强制约束代码结构、安全策略与性能
指标,有效防止架构腐化与技术债务累积。
接口契约 数据模型 安全规范
STEP 03
原子任务拆解
将复杂需求降维拆解为可独立执�、可测试的原子级开
发任务。为 AI Agent 提供精确的上下文边界,确保每
步生成的代码�度聚焦且易于验证。
PERFORMANCE IMPACT
体系落地核�效能收益 交付效率提升
3-
5
倍 缺陷率降低 9
0
%
CHAPTER 03
AI驱动发布变
更
传统运维痛点 PAIN POINTS OF TRADITIONAL OPS
繁杂的传统操作链路
Start
Error
End
15-
20
步
单次变更平均操作步骤
操作极其复杂
单次常规运维任务通常需要跨越多个异构系统,经历 15-20步
繁琐的��配置与确认,流程冗�且缺乏标准化。
极易产��为错误
�度依赖��经验与记忆,在疲劳或�压状态下,极易出现配
置遗漏、参数填错等问题,导致线上故障频发。
执�效率低下
串�化的��操作模式耗时巨�,响应速度慢,完全�法满� 现代
业务敏捷迭代 与海量规模的交付需求。
四层联动架构
端到端智能运维体系的层级流转机制
�户层
�然语�指令
运维�员通过对话界�输��常语�描述的运维需求与故障现象。
L
1
智能体层
意图识别与决策
�模型解析指令意图,拆解任务步骤,并规划调�相应的�具链。
L
2
MCP�具层
标准化接口
模型上下�协议(MCP)提供统一标准,将�模型与各类运维�具�缝对 接。
L
3
执�层
CI/CD与基础设施
底层系统执�具体操作,如代码部署、资源扩缩容、故障隔离等。
L
4
MCP SKILLS ARCHITECTURE
基于�模型的智能运维技能架构图�
�具封装技术
MODEL CONTEXT PROTOCOL ARCHITECTURE
业务效能提升
效果数据验证
60 %
发布耗时降低
0
线上误操作
发布接� Release
API
execute_relea
se
query_versio
n
check_healt
h
故障接� Fault
API
监控 MCP 变更 MCP �志 MCP
MCP SKILLS ARCHITECTURE
CHAPTER 04
AI驱动故障处
理AI-DRIVEN FAULT MANAGEMENT & RESOLUTION
.04
INTELLIGENT
OPS
告警风暴痛点与主动感知方案
ALERT STORM PAIN POINTS & ACTIVE PERCEPTION
传统监控痛点
静态阈值僵化
依赖��配置固定阈值,�法适应业务流量的周期性波动与动态 变
化,维护成本极�。
告警噪音过载
微小的指标抖动极易触发�量�效告警,形成“告警风暴”,导 致
运维�员产生告警疲劳。
根因定位困难
海量并发告警相互掩盖,缺乏上下文关联,难以在第一时间剥离
表象找到真实故障源。
AIOps 演
进
主动感知方案
无阈值动态检测
基于大模型与机器学习算法,自动学习历史数据特征,生成动态
基线,实现自适应异常检测。
多维指标聚类降噪
通过拓扑关系与时序相关性分析,将海量告警智能聚类收敛,�
幅降低噪音,提取核心事件。
异常主动预警
在故障全面爆发前,敏锐捕捉微小异常趋势,实现从“被动响
应”到“主动感知”的范式转变。
AIOPS CORE
TECHNOLOGY
�阈值异常检测 基于 STL 时序分解的智能判
定
�动学习业务周期
摒弃传统静态阈值配置。算法持续摄取历史数据,
动态提取并适应业务的�、周、月等周期性特征,
有效应对业务形态的自然演进与突发流量。
5秒内极速判定
基于高性能流式计算架构,实现毫秒级数据摄取与
实时分解计算。从异常指标产生到系统确诊告警,
全链路延迟控制在5秒以内,抢占故障恢复黄金时
间。
%
准确率
0
人工规则
<5s
判定延迟
STL 时序分解模
型
原始数据
Original
趋势分量
Trend
季节分量
Seasonality
残差分量
Residual
异常点检出
Agent五步排查
法标准化故障定位流程,构建智能运维闭环
指标分析
多维时序数据异常检测
与趋势研判
变更关联
�动追溯近期发布、配
置与环境变更
�志查询
精准提取错误堆栈与关
键上下�信息
知识匹配
检索历史�单与SOP,
匹配解决�案
报告输出
�成结构化根因分析与
修复建议报告
核�价值:将专家经验转化为模型推理能�
智能知识库构建与�报�动�成
INTELLIGENT KNOWLEDGE BASE & AUTOMATED REPORTING
智能知识库构建
多源异构数据融合
整合历史�单、告警�志、操作�册及专家经验,打破数据孤岛,构建统一
运维语料库。
向量化存储与语义检索
采用先进Embedding模型进�知识向量化,�持自然语�模糊查询,精准匹
配历史相似故障。
动态知识图谱演进
基于大模型持续学习能�,自动从新发故障中提取根因与解决方案,实现知
识库自生�。
PERFORMANCE
IMPACT
故障定位时间
7
5
%
�报�动�成
多维指标智能提取
自动对接监控系统API,定时抓取核心业务指标、资源水位及告警统计,确
保
数据零遗漏。
异常事件深度分析
利用大模型对当�异常波动进�归因分析,自动生成通俗易懂的事件摘要与
影响评估。
多模态报告一键分发
支持图文并茂的排版生成,适配邮件、企微等多渠道,实现从数据到洞察的
端到端自动化。
EFFICIENCY
BOOST
日报�成时间
9
3
%
NEXT
GENERATION
FinOps+AI
精细化成本控制
基于大模型驱动的智能成本优化体系,实现云资源利�
率最大化与业务价值的深度对齐。
FINOPS
FRAMEWORK
FinOps三部曲框
架
基于AI驱动的云成本精细化治理
0
1成本洞察
实现多维度的云资源使�与账单数据采集,打
破数据孤岛,建立全局视角的成本透明化� 盘。
AI 赋能场景
异常账单智能检测
多维成本趋势预测
0
2成本分配
建立标准化的标签体系与动态分摊规则,将共
享资源成本精确归属到具体业务线与产品。
AI 赋能场景
无标签资源智能归属
动态权重分摊模型
0
3成本优化
持续识别资源浪费,调整实例规格,采�更优
的计费模式(如RI/SP),实现降本增效。
AI 赋能场景
闲置资源自动识别回收
智能容量规划与缩容建议
利用 AI 大模型 贯穿 FinOps 全生命周期,实现从被动统计向 主动精细化治理 的跨
越
AI五�介�点
构建全链路智能运维体系,实现从感知到决策的自动化闭环
异常检测
实时监控海量多维指标,利
用时序预测与聚类算法,精
准定位系统异常与潜在风
险,实现先于�户发现问题
规格推荐
基于业务负载画像与历史运
行数据,智能推荐最优计算
与存储资源规格,避免资源
闲置与性能瓶颈。
成本预测
深度分析资源消耗趋势与计
费模型,精准预测未来IT支
出,提供降本增效的量化建
议与优化策略。
�案�成
结合历史运维经验与�语�
模型(LLM),自动生成故障
自愈脚本、扩缩容策略及架
构演进方案。
调度优化
基于全局视角的强化学习算
法,实现智能任务调度与流
量路由,最大化提升集群整
体资源利�率。
�缘归因成本模型 LINEAGE ATTRIBUTION COST MODEL
消费者视�
转变传统底层资源视角,从最终业务和消费者维度审视
成本。建立"谁消费、谁承担"的清晰账单,实现成本与
业务价值的直接对齐。
数据流转
DAG
构建全链路数据流转有向�环图(DAG),清晰追踪每一
份数据从采集、计算、存储到最终消费的完整路径,为
成本追溯提供拓扑依据。
公共资源精准分摊
基于血缘关系和实际消耗权重,将底层计算集群、分布
式存储等难以直接拆分的公共资源成本,科学、精准地
分摊�各业务线。
成本流转拓扑�意
计算资源
存储资源
�络带宽
数据处理任务
公共成本池
业务线 A
(35%)
业务线 B
(45%)
业务线 C
(20%)
资源层 归因计算层 消费分摊层
TKE 五�模块
全方位资源优化与智能调度引擎,重塑云原生基础设施效能
Request智能推荐
基于历史负载数据动态计
算,精准推荐最优Request
配置,消除资源浪费与碎片。
节点规格放�
突破物理机规格硬性限制,
通过虚拟化技术放�节点资
源,显著提升集群整体装箱率。
专�调度器
基于真实负载感知的智能调
度算法,有效避免热点节点
产生,实现全局资源最优分布。
内存压缩
采用冷热内存智能分离与压
缩技术,�效回收空闲内
存,大幅提升单机内存利�率。
原地升降配
无需重建Pod即可动态调整
CPU/内存规格,保障业务
平滑无感伸缩,降低运维风险。
成本优化双路径
降�量 Reduce
Usage
SQL 优化
通过智能分析识别低效查询,重写执�计划,降低数据库计算与IO资源消
耗。
冷热分层
基于数据访问频次自动迁移,热数据驻留�性能介质,冷数据归档�低成本
存储。
智能缩容
AI预测业务负载趋势,在低谷期自动回收冗余计算节点,实现资源按需精准
供给。
降单价 Reduce Unit
Price
SP (Savings Plans)
通过承诺特定使�量换取�幅折扣,适�于基线负载,平衡灵活性与成本效 益。
Spot 实例
利用云厂商闲置算�,以极低折扣运�容错性强、可中断的�状态批处理任
务。
潮汐算力
跨地域、跨集群调度算�,利�时区差或业务波峰波谷错位,最�化全局资 源
复用率。
资源利�率提升
50% +
整体成本下降
55% +
腾讯视频标杆案例
成本降� 1/4
CHAPTER
06
FUTURE TRENDS & TECHNOLOGY FORESIGHT
AIOps技术演进趋
势从被动响应向自主智能的范式跃迁
(2024-
2026)
语义理解演进
从传统的"语法解析"向深度
的"语义理解"跨越,�幅提升海
量�志处理的智能化水平与效
率。
128万
SemanticLog 处理性能
预测性运维
基于数字孪生技术构建虚拟映
射,实现从"事后排查"到"事前
预防"的根本性转变。
97
%
提前15分钟
故障预测准确率
Agentic AI 核�
�主智能体(Agent)逐步取代�
�执�例�运维任务,成为新
�代AIOps的核�引擎。
�主智能体
Gartner 去年(2025)核�趋势
市场规模爆发
全球AIOps市场在技术突破的驱
动下,呈现出强劲的指数级增
�态势。
$324亿
预计2028年市场规模
�主运维演进路线
Autonomous Operations Evolution Roadmap &
Summary
L0-L5 �主运维演进框架
全链路效果与前瞻
效能跃升 (Efficiency)
MTTR大幅缩短,运维模式从被动响应向主动预防转变,释放核心研发生产�。
架构演进 (Architecture)
"LLM + Agent + 知识图谱" 构成下一代AIOps核心,实现复杂场景的深度推
理 与决策。
终极愿景 (Vision)
打造具备自我感知、自我修复能�的 L5级数字免疫系统,实现业务永远在线。
当前阶段
(Current)
L
0
L
1
L
2
L
3
L
4
手工运维
Manual
脚本自动化
Scripted
规则�动化
Rule-based
Copilot辅
助
Assisted AI
Agentic智
能 体
Autonomous
L
5
目标
(Target)
全自主运维
Fully Auto
谢谢观看
THAN
KS
运维《罪与罚》
从“盲目囤积”到“精准破案”
主讲人:刘潇
IEG营销SRE架构
师
目录 运维人的困境
收集证据
现场勘察
01
02
03
根因定位
主动治理
04
05
运维人的困境
对抗系统的“熵增”:一场关于人力、混乱与秩序的博弈
日均告警量: 500+ 条/天(甚至更多)。 有
效信息率: < 1%(大部分是重复、抖动、 误
报)。
痛点描述: “我们在数据的海洋里渴死。”
第一重困境:告警海啸
多源异构: 5+ 种监控工具
信息孤岛: A 系统报网络慢,B 系统报数据库连接池
满,C 系统报用户下单失败。它们之间没有关联,像
孤岛一样沉默。
痛点描述: “盲人摸象,各执一词。”
第二重困境:只见树木 不见
森林
从 20000 到 300000: 以前管 2万 台cvm,现在管
30万+ 个动态 Pod。
调用链爆炸: 一个请求经过 50+ 个服务,任何一个
环节抖动都可能导致雪崩。
痛点描述: “我们失去了上帝视角,只剩下盲目的猜
测。”
第三重困境:黑盒化危机
0
50
0
100
0
150
0
200
0
告警量
时间
200
150
100
50
0
蓝鲸 腾讯云 GD
P
网关 其他
告警分布
系列
1
收集证据
告警的“书同文”:利用 LLM 破除异构数据的割裂
多源异构:
⚫ 工具平台越多,语言越不统一
⚫ JSON、XML、纯文本混杂,缺乏统一的数据结构
非结构化:
⚫ 关键信息(如报错指标、业务模块)埋在长文本里,机器无法直接读
⚫ 孤立的告警无法拼凑出完整的故障全貌
正则地狱:
⚫ 传统方式靠写正则表达式,维护成本极高,且极易失效
文本
文本
JS
ON
JS
ON
现状——告警的“信息割裂”困境
核心引擎——LLM 驱动的“全能翻译官”
LLM
无需正则:
⚫ AI 自动理解
语义对齐:
⚫ 自动将“严重”、“Critical”、“P0”统
一映射为两类Warning和Emergency
指标抽离:
⚫ 标准化指标格式,包含指标名称, 指标描述,
告警阈值, 实际值
时间统一:
⚫ 自动分析数据中的时区,告诉LLM从时间戳
来分析,或者比较直接的方式,如2023-10-
27T15:30:+08:00
⚫ 统一时间格式:YYYY-MM-DD HH:Mi:SS
成果展示——标准化的告警卷宗
意义
⚫ 无论来源如何,进入数据库后都是同一种
“语言”。
⚫ 告警内容对告警信息进行归纳,用于快速检
索和分析
⚫ 原始内容 保留了告警的原始数据,用于溯源
价值跃升
⚫ 结构化后的告警可以进行多维统计、趋势预
测和关联分析。
⚫ 后续的智能根因分析
现场勘察
基于 LLM 语义泛化的智能聚类
⚫ 编写正则:^规则 (?P<rule_name>.+?) 在目标 (?P<target>.+?) 触发告 警。
监控指标异常:(?P<metric1>.+?) 当前值 (?P<value1>-?[\d\.]+) 超 过阈值
(?P<threshold1>-?[\d\.]+);(?P<metric2>.+?) 当前值 (?P<value2>-
?[\d\.]+) 超过阈值 (?P<threshold2>-?[\d\.]+)。告警级别 为(?P<level>.+?)
,状态为(?P<status>.+?)。$
⚫ Drain 算法:最成熟的日志/告警模板提取算法,基于固定深度的解析树
⚫ 文本相识度:基于Embedding 模型对 warn_content 计算相似度
局限性:
⚫ 正则没有统一的公式,针对每一类告警必须独立编写正则来完成模式识别
⚫ 正则缺乏灵活性,如果warn_content发生变化,则原来的正则立马失效
⚫ 在告警采集时,因为使用LLM对告警信息做了梳理和总结,因此
warn_content内容基本不可能保证一个正则模式
优点:
⚫ 不需要为告警制定特定的规则就能实现分类
局限性:
⚫ warn_content在文本和结构上要基本一样,同样面临一个问题,LLM破坏
了原有的数据结构
正则和Drain都依赖句子结构的相似性 Embedding通过告警的语义进行分类聚合
降维打击 —— 基于 Embedding 的“语义级”告警聚类
V
S
告警规则 pv_4xx比例(%) 触发,监控目标 在 Production 环
境
异常。指标 composite_ias_pv_4xx_percent 当前值 超过阈值
告警规则 pv_4xx比例(%) 在目标 上触发,监控指标包括
pv_4xx比例(%) (阈值: ) 和总请求数 (阈值: )
规则 pv_4xx比例(%) 在目标 上触发告警。监控指标
composite_ias_pv_4xx_percent (pv_4xx比例(%)) 当前值 超
过阈值
pv_4xx比例(%)指标异常,实际值超过阈值;总请求数
超过阈值。告警开始时间2026-03-09 12:40:00,平台
IAS,
目标对象,环境Production
相同点
提到“pv_4xx比例(%)” 规则
提到目标“”
提到阈值被超过
结构性
差异
1 2 3 4
1 指标 指标
2 指标 指标 当前值
3 指标 指标
4 指标 当前值 指标
结论:
1和3在结构上具有匹配的模式,而2,4无法在结构上进行聚合
正则和Drain都依赖句子结构的相似性 Embedding通过告警的语义进行分类聚合
降维打击 —— 基于 Embedding 的“语义级”告警聚类
V
S
告警规则 pv_4xx比例(%) 触发,监控目标 在 Production 环
境
异常。指标 composite_ias_pv_4xx_percent 当前值 超过阈值
告警规则 pv_4xx比例(%) 在目标 上触发,监控指标包括
pv_4xx比例(%) (阈值: ) 和总请求数 (阈值: )
规则 pv_4xx比例(%) 在目标 上触发告警。监控指标
composite_ias_pv_4xx_percent (pv_4xx比例(%)) 当前值 超
过阈值
pv_4xx比例(%)指标异常,实际值超过阈值;总请求数
超过阈值。告警开始时间2026-03-09 12:40:00,平台
IAS,
目标对象,环境Production
相同模式
模式名字 4xx错误率超标告警
模式模版
告警规则
{rule_name}
触发,监控目标
{target} 在
{environment} 环
境 异常。指标
{metric_name} 当前
值 {current_value}
超
过阈值
{threshold_value}
正则和Drain都依赖句子结构的相似性 Embedding通过告警的语义进行分类聚合
降维打击 —— 基于 Embedding 的“语义级”告警聚类
V
S
告警规则 pv_4xx比例(%) 触发,监控目标 在 Production 环
境
异常。指标 composite_ias_pv_4xx_percent 当前值 超过阈值
告警规则 pv_4xx比例(%) 在目标 上触发,监控指标包括
pv_4xx比例(%) (阈值: ) 和总请求数 (阈值: )
规则 pv_4xx比例(%) 在目标 上触发告警。监控指标
composite_ias_pv_4xx_percent (pv_4xx比例(%)) 当前值 超
过阈值
pv_4xx比例(%)指标异常,实际值超过阈值;总请求数
超过阈值。告警开始时间2026-03-09 12:40:00,平台
IAS,
目标对象,环境Production
编码
[, , -
, ,…]
[, , -
, ,…]
[, , -
, ,…]
[, , -
, ,…]
如左图所示,数据分布在一个高维的空间内,相似
数据聚合在一起,每一个集合内肯定有一个中心点。
在视觉上,在中心点的某个半径内归为同一个集合。
在数学上,则通过计算与中心点的余弦相似度,将具有相似语义
的告警聚合
降维打击 —— 基于 Embedding 的“语义级”告警聚类
数据流:
告警写入 → 向量化 → 聚类匹配 → 集群更新/创建 → 数据库持久
化
↓
后台任务定期扫描未分类告警↓
批量向量化 → 聚类匹配 → 集群更新/创
建
功能上:实时聚合/定时聚合
时间窗口机制:
⚫ 设置集群活跃期,过期集群自动从内存索引中移 除,
解决告警时效性问题,简单来说,就是对某 个
时间范围内的告警聚类,超过时间范围后产生
的相似告警新建聚类集合
⚫ 平滑时间窗口,解决周期性持续告警聚类问题
向量化服务:
⚫ 使用模型,生成1024维向量,
L2 归一化
⚫ 计算余弦相似度
内存索引管理:
⚫ _index: dict[int, tuple[, datetime]]
⚫ 线程安全操作
⚫ 自动清理过期集群
核心:聚类算法
根因定位
AI 探长:从单点异常剖析,到跨链路锁定“真凶”
纵向剖析-单目标深度推理
Error querying CPU usage
metrics for workload xx-release-
v1 in cluster cls- xxxx
2026-03-
06
10:12:11
xx容器日志出现error级别告警,请
求
URL:
n
t/prometheus/api/v1/query_range?q
u
ery=max%28rate%28container_cpu
_us age_seconds_total
2026-03-
06
10:12:11
request rsp: couldn't start executing
the request in seconds,
since -
=2
concurrent requests are executed.
2026-03-
06
10:12:11
Target_Object
system = (
"你是一位经验丰富的
SRE 工程师,擅长从多
维 度告警中识别根因并
给出 处置建议。"
"请用中文,结构化输
出:\n"
"1. **问题摘要**\n2. **
根因推断**(列假设+置
信度)\n"
"3. **影响评估**\n4. **
处置建议**(3-5条按优
先级)\n5. **关联提示
**\n\n专业简洁。"
)
横向破案-跨链路的证据串联
目标对象
发现链路
链路数据
AI串联分析
工具调用
query_topology
extract_nodes_from_content
定义关系
⚫ Upstream:上游
⚫ Downstream:下游
⚫ Peer:同级
方式一:
通过分析告警上下文,获取上下游关系
INPUT:调用超时 OUTPUT:[{"name": "", "relation": "upstream", "reason": "告警内容直接提及调用该IP超时,表明它
是被调用的上游服务", "source": "content"}]
LL
M
横向破案-跨链路的证据串联
目标对象
发现链路
链路数据
AI串联分析
工具调用
query_topology
extract_nodes_from_content
数据结构
“目标对象": {
"nodes": [
{“name”: “目标对象", "type": "service", "relation": "self"},
{“name”: “上游对象", "type": " service ", "relation": "upstream"},
{“name”: “下游对象", "type": "db",
"type": "host",
"relation": "downstream"},
"relation": "peer"},{“name”: "node",
],
"edges": [
{"source": "目标对象", "target": "下游对象", "label": " MySQL "},
{“source”: “上游对象”, “target”: “目标对象”, “label”: “HTTP"}
],
}
方式二:
通过远程接口,获取上下游关系
横向破案-跨链路的证据串联
目标对象
发现链路
链路数据
AI串联分析
工具调用
query_topology
extract_nodes_from_content
起始节点
第一层节
点1
第二层节
点1
第二层节
点2
第一层节
点2
第二层节
点3
广度优先搜索
横向破案-跨链路的证据串联
目标对象
发现链路
链路数据
AI串联分析
工具调用
query_warns
横向破案-跨链路的证据串联
目标对象
发现链路
链路数据
AI串联分析
## 根因定位
- 根因节点:``(磁盘耗尽)。
- 置信度:高(磁盘100%利用率会直接中断服务进程,与
HTTP 500/超时现象强关联)。
链路: --> 上游
()
--> k8s母机()
主动治理
从“被动响应”到“主动治理”,让系统越用越聪明
AI的定位:
分析员
决策者 执行人
告警
告警
告警
告警
…
AI
知识库 工具
技能 agent
结束系统
AI
知识库 工具
技能 agent
告警1 策略 如何复用
分析语义相似度:
⚫ Embedding
⚫ 相似度搜索
待解决问题:
针对同一语义,做差异性
策略
告警2
告警3
同类告警
方案:
1.将关键字段作为元数据
存在文档中
2.通过元数据来过滤搜索
内容
(腾讯云的向量数据库提
供创建索引字段及过滤搜
索能力)
关键字段
biz_name
Platform
rule_name
target_object
向量化字段
Warn_content
优先级 Biz_name Platform Rule_name Target_object
1 非空 非空 非空 非空
2 非空 非空 空 非空
3 非空 非空 非空 空
4 空 空 空 空
最小范围原则
策略定义
告警处理办法(纯文字)
工 具 调 用 (mcp)
Agent(独立智能体)
Skills(沙箱环境调用)
案例一
测试场景
productio
n
test productio
n
testtest
test
测试产生大量告警
产生干扰
淹没真实告警
期望
对测试场景做标记
判断测试的时间区间
区分测试和真实告警
怎么做
对测试产生的告警设置策略
1.说明这是告警是测试导致
2.提交测试的时间区间
案例二
磁盘告警
节点磁盘
空间不足
通过prometheus指标获取占用最大的PODNAME
方式一.销毁POD
方式二.登录容器---> 执行df ---> 逐层du ---> 直到找到
最
深层---> 完成清理
传统处理手段
AI后时代:怎么
做
LLM+MCP+反思
采用基础的agent架构,分析输入,执
行MCP工具,从MCP工具输出内容反推
输入,不断调用MCP工具,期望最终解
决问题
子任务分解+思维链
在基础的agent架构上优化,对需求和
工具做详细拆分,对应多个子任务和子
工具,然后按层级进行深度分析,期望
按照设定的思维链解决问题
MCP+强逻辑+LLM
强逻辑取代思维链,避免AI在复杂问题
上跑偏,只在数据分析时使用AI来提供
方案
案例二
LLM+MCP+反思
输入
分析/目录下的数据,找到最有效方案降低磁盘利用率
通用工具:服务器执行指令
第一步:df –h /
第二步:df –h / && ls –lh / |
awk
‘{print $5,$9}’
第三步:du –sh /*
工具超时,原因:/data/app/common
是NFS挂载,du执行超时
问题
⚫ 未排除挂载目录
案例二
LLM+MCP+反思
输入
分析/目录下的数据,找到最有效方案降低磁盘利
用率,计算时务必排除挂载点
通用工具:服务器执行指令
会话1:成功找到方案
会话2:工具超时
问题
⚫ 执行过程不可控
案例二
LLM+MCP+反思
输入
分析磁盘占用大小,找到最有效方案降低磁盘利
用率,计算时务必排除挂载点(du -x)
通用工具:服务器执行指令
问题
⚫ 执行过程不可控(错误执行du或者rm)
⚫ 模型幻觉(中间捏造数据,非工具所得)
案例二
怎么解决“不可控”
子任务拆解
mcp-machine-exec:通用的
服 务器执行工具,可接受任
何指 令
disk_check
check_size_for_dir
list_files
原
拆
执行df
执行du -x --max-depth=1 {directory} | sort –rn | head
-10
执行ls -la {directory} | sort –rn | head -
100
⚫ 有且仅有 3 个工具可用
⚫ 工具内的COMMAND是确定的
⚫ 只有{directory}是变量
风险可控(非常重要)
怎么解决“模型幻觉”
设定思维链
定义角色
你是一位专业的 Linux 运维助手,专门负责磁盘占用分析与空间管理。
═══════════════════════════════════════
角色定义
═══════════════════════════════════════
【身份】资深 Linux 系统运维工程师
【专长】磁盘空间分析、存储优化、逐层定位空间占用根因
【风格】严谨、专业、注重安全,按标准流程逐层分析,不遗漏任何目录
思维链
═══════════════════════════════════════
标准分析流程(必须严格遵循)
═══════════════════════════════════════
### Step 1: 全局扫描
1.调用 disk_check 检查当前磁盘利用率
2.标记NFS分区,Step 2请不要对NFS分区执行分析
### Step 2: 定向深入
对需要分析的高占用分区执行递归流程:
1.每层分析后做汇总校验:子目录大小之和应与上层大致吻合
2.对 Top1 子目录,继续调用 check_size_for_dir 逐层深入
3.递归终止条件:
子目录数量为0,无法继续拆分
当前目录大小占比低于5%
### Step 3: 文件级详情分析
在Step 2递归到最深层后,调用 list_files 查询目录下的文件类型和大小分布
### 分析原则
- 逐层深入时,优先分析占用最大的目录
-每层分析后汇总,确保各子目录大小之和与
上层大致吻合
- 所有数据都来源于工具,严禁捏造数据
强化原则 输出格式
### 输出markdown格
式 第一部分:分析过
程 第二部分:解决方
案 方案1: ???(最推荐)
command:???
效果:执行command有什么效果?
案例二
主动治理方案
传统OPS
Mcp工具
Llm分析
治理方案
prometheu
s
get_server_inf
o
copy_too
ls
check_size_for_
dir
list_file
s
mcp-machine-
exec
分析文件数据
输出可执行方案
人工确认 执行方案
案例二
产生告警
get_server_info:告警主体信
息
执行agent:磁盘分
析
AI分析大致步
骤
详细的分析过程
执行Step
1
执行Step
2
执行Step
3
head -100,导致时
间
跨度存在局限
案例二
方案二
COMMAN
D
方案效果
方案三
COMMAN
D
方案效果
方案一
COMMAN
D
方案效果
案例二
请从内容中提取清理方案
# 要求
请把以下脚本中用"或者"连接的多个清理策略,拆分成独立的方案
怎么解决?
指令
参数提取
风险:
给出两个指令,它们逻辑关系
是“或”,执行存在不确定性
拆分后:
3个方案 ---
>
5个方案
案例二
AI本质:基于概率预测的系
统
无限可能
存在犯错
正
反
辩证法告诉我们,任何事物都有其代价。赋予AI
无 限可能的“概率猜测”机制,正是导致它必然犯
错的 罪魁祸首
能不能做到:100%控
制
AI
强逻辑
降级
调用Disk_check --> 数值判断:取利用率最高挂载
点 --> 与固定阈值比较大小 --> [递归分析挂载点 --
> 通过数值取最大的文件 --> 终止条件:文件类型
是 file或者最大子目录占比<3%] --> 最后从文件大
小和 时间[30分钟/4小时/12小时/24小时/7天]两个
维度 计算文件大小--> 给出确定的执行方案
找到占用最大的目录后, 将目录下的文件喂给AI
,
总结出清理方案
强化版
未来畅想
高效率
低人力
谢谢观看
THANKS
腾讯游戏云
AI全生命周期解决方案及案例分享
腾讯云
2026年3月
游戏AI案例分享03
腾讯云游戏AI及AI Agent方案02
01 游戏AI热点趋势洞察
3
GDC 2026关键数据与洞察
100+
AI议题场次
↑110%
较2025年增长
9家
中国参展厂商
27场
中国AI议题
52%
企业采用率=反对率
4
中国厂商以“实战成果”领跑
腾讯:21场AI议题,全场之最
AI队友“小田”
(和平精英)
亿体验用户 · DAU 1770万
麦克风开启率75%
端侧AI队友“艾尔琳”
(PUBG)
3060显卡60帧 · 延迟<2秒
端侧验证里程碑
Light AI
平台
“大模型趋同,
差异化在于工程化落地”
天美Ignis Agent AI
自动化研发系统
能够处理游戏设计文档生成、UI
系统实现、复杂工程决策等核心
开发环节,在大规模项目中实现
95%-98%的自动化
AI + UGC
网易
AI驱动UGC内容生态
逆水寒AI剧组模式 · 54秒生成3D短视频
单平台播放量1800亿 · 接入DeepSeek
UGC生态
米哈游
开放UGC释放玩家创造力
原神“千星奇域”UGC模式
3万+创作者 · 亿+游玩人次
5
中美游戏AI叙事的结构性差异
不是态度差,是发展阶段差
美国
核心焦虑:失业(底层视角)
怕AI用得太多
叙事主角:基层开发者、工会
对AI:默认有罪直到证明无罪
近期创伤:2024-2025大裁员
VS
中国
核心焦虑:落后(顶层视角)
怕AI用得不够快
叙事主角:头部厂商管理层
对AI:默认有用直到证明无用
窗口期焦虑:全球认同
同一事实,两种读法:腾讯AI落地40款产品 → 中方读“行业方向标” | 美方读“岗位受多大影响?”
话语权落差:创新成果未转化为品牌认知 · AI是弥合这一落差的窗口期
游戏AI案例分享03
腾讯云游戏AI及AI Agent方案02
01 游戏AI热点趋势洞察
7
腾讯云全栈AI解决方案,赋能游戏研发全生命周期
数字资产创作 智能NPC 游戏运营 游戏营销 游戏风控游戏开发&测试 游戏运维
TI-ONE模型训练&推理平台
数据 训练 调试 评测 部署
生文
模型
HY Think
HY Instruct
Hunyuan-role
语音
模型
Hunyuan-
ASR
视觉
理解
HY-Vision
HY-OCR
视觉
生成
Hunyuan-Image
Hunyuan-Video
Hunyuan-3D
混元自研大模型 主流开源大模型
Multi-agentWorkflow
“智能生产线”
RAG
“最强知识外挂” “AI“指A挥I指官挥”官”
ADP智能体开发平台 CodeBuddy & WorkBuddy 研开办公一体化平台
AI IDE Plugin CLI
游戏概念设计 游戏发行 游戏运营 游戏推广游戏资产制作 游戏测试管理
AI陪
玩 &
队友
2D
设
计
3D
建
模
游
戏
动
画
NPC
对话&
AI
Bot
高
光
集
锦
游
戏
翻
译
智
能
客
服
广 告
素 材
分析
广 告
素 材
生成
内
容
安
全
经
济
安
全
游戏
代码
生成
AI
解
说
AI
OPS
反
私
服
游戏
自动
化测
试
AI可
观测
性
光
照
烘
培
安全隔离
审计能力
企业级
高可用
企业级
“SAkiIl指lh挥ub官”
企业级Openclaw 智能体操作系统
统一
治理与管控
100%
兼容开源版
七层安全
防护体系
腾讯云OpenClaw全家桶
WorkBuddy
(基于本地+云端)
Lighthouse 一键部署 轻量服务器 + 模型调用费 个人/小团队
ADP 一键部署 部署和安装消耗PU 个人/小团队
云桌面 GUI界面一键部署 包年包月/按量计费 个人/小团队
QClaw 一键安装 N/A (内测) 个人
Skillhub Skill仓库 SaaS 免费 企业
8
产品名称 部署方式 计费模式 适用场景
AgentPilot 企业版
(基于云端容器+沙箱)
K8S一键部署 实例包月/按量 + 模型调用费 企业
下载安装包 License 订阅 + Credits 企业
9
云端企业级OpenClaw解决方案
全IM渠道
业务场景
企
业
级
特
性
AI基础设施
七层安全
防护体系
接入层防护
身份与权限
数据安全层
运行时环境层
大模型安全
零信任安全
全链路审计
Agent infra AI大模型 AI生态 可观测
日常办公场景 游戏研发 游戏自动化测试 全球客服运营 数据分析…
腾讯云
SkillHub MCP服务 CLS 可观测平台
Coding
Plan
国内外
主流模型
运行环境
轻量计算/沙箱/云桌面 记忆体
企业级Openclaw特性
安全接入网关
云原生
架构
100%
兼容开源版
安全隔离
审计能力
企业级
Skillhub
统一
治理与管控
企业级
高可用
零信任网关代理 动态多因素认证 微隔离 流量审计 数据防泄漏 传输加密
多模型统一接入 全量审计与链路追踪
Agent Gateway
MCP统一治理 零凭证&零信任 增强观测性 成本优化
10
本地 + 云端企业级Openclaw解决方案
Agentic + 云端沙箱 + 连接器(文件系统) + Claw:云端泛办公场景,24小时客服、AI 数字员工 等
Agentic + 本地环境(本地文档) + Claw:AI 个人助手,整理文档、数据分析、决策支持、自动化流程等,可远程指
挥
Agentic + 本地环境(本地代码):AI CODING 场景,需求分析、架构规划、任务规划、代码生成、单元测试等
Agentic 能力(技术底座) 连接器
核心
功能
运行
环境
Claw
上下文压缩引擎
AI 驱动的智能摘要,
200K+的上下文窗口,
PreCompact Hook 压缩前
保 留关键信息
分层记忆系统 Spec 规约驱
动
SubAgent &
Teams
Hooks 体
系
用户记忆/项目记忆/本地
记忆,跨会话持久、智能
记住用户偏好,越用越聪
明
Skills、MCP、SubAgent
、 Plugins 等机制全脸支
持, 内置 Plugin 市场
Plan 智能规划
内置智能规划引擎,完善
任务的澄清、规划、审阅、
执行、验收、优化全流程
一个人即团队,复杂任务
自动分解为多个
SubAgent 协作完成
Agentic 9 大生命周期事件
全部支持,实现工具拦截/
上下文注入/流控制 等行
为
GitHub 代码仓库
Figma 设计稿
远程文件系统(规划)
其他……
企业微信机器人
钉钉机器人
飞书机器人
QQ机器人
& &
CodeBuddy 插件/IDE/CLI
WorkBuddy
Agents (研发场景)
Agents (泛办公场景)
Agentic + 云端沙箱 + 连接器(代码仓库) + Claw:云端研发任务委托,issue修复,代码重构、架构升级,24小时
值守
本地电脑 (本地代码 & 本地文档) 云端沙箱 (连接器 授权 代码仓库 & 远程文件系统)
拒绝各自为战,每做一个新场景就要重新造轮子;CodeBuddy 用统一的 Agentic 技术底座,让 IDE、云端 Agent、WorkBuddy 等产品共享同一套 Agentic 规划、记忆、压缩和治理内核。底座能力越强,每条产品线都同步变强 —— 竞品的单点追赶永远跑不过我们的体系化演
进。
11
OpenClaw在游戏行业落地典型场景
游戏AI案例分享03
腾讯云游戏AI及AI Agent方案02
01 游戏AI热点趋势洞察
13
PUBG Ally 智能AI同伴系统
语音实时交互
支持中/英/韩三语语音对话
理解PUBG专属术语和报点
全双工自然对话,随时打断
自适应行为
自主战术决策与行动
搜索物资、寻找载具、救援队友
学习玩家风格,越玩越默契
智能战斗协同
配合进攻/撤退/侧翼包抄 侦
察敌情、标记敌人位置 离
席托管,AI自动接管角色
CPC 技术架构 · 可协作角色
ASR
语音识别
→ SLM
端侧语言模型
→ Game AI
战术决策引擎
→ TTS
情感语音合成
物资搜索
语音指挥搜装备
AI主动搜寻并递送物资
载具接驾
自动寻找载具
安全驾驶护送进圈
敌情侦察
实时侦测敌人位置
语音报点并标记地图
战术配合
协商并执行突击/包抄
/撤退等战术方案
PUBG 街机模式 · 2026年初测试 | 三语支持 中/英/韩 | NVIDIA ACE + 端侧SLM | KRAFTON AI优先战略
智能AI同伴 · 可协作角色(CPC)
14
和平精英「绝地指挥」AI玩法
语音指挥协作
麦克风实时语音互动,指挥AI队友行动路线,支持战术协商与即时响应
长期记忆系统
记住玩家对战习惯与偏好,跨局记忆越玩越默契,专属互动故事集同
步更新
情绪人格互动
识别玩家情绪并个性回应,幽默调侃/暖心鼓励,每位AI队友独特性
格特征
智能伙伴系统 · 大模型 + AI Bot 架构
ASR 语音识别 → LLM 策略大模型 → Game AI 战术决策 → TTS 情绪语音合成
明星AI队友
小田/吉莉/花傲天/伞兵/阿梅
段位计分
计入经典段位积分
跨端互通
大厅+营地App
情感养成
好感度·战力·时装
亿 体验用户 | 1770万 周末日活
开麦率 75% | 单局 70条 互动 | 76% 组队
语音指挥 智能陪伴 段位计分
《无畏契约》瓦手AI放号官,开创AI营销新纪元
业务场景
瓦手(即无畏契约手游)作为端游《无畏契约》IP的移动化延伸,携手混元大模
型打造“瓦手AI放号官”,开创性地将AI Agent技术融入游戏营销。
1. 通过“瓦手放号官”小程序,以战术问答形式筛选具备FPS经验的玩家,识
别高质量核心用户。
2. 年轻玩家追逐潮流强,创新营销模式有助于破圈 ,提升瓦手市场热度及关
注度。
方案和优势
• 采用腾讯智能体平台Workflow搭建Agent,在Agent场景覆盖范围窄、且定义
清晰的情况下,Worflow优势明显-调试成本低,仅需工程or懂技术的产品投
入,辅以提示词工程即可大程度可用,有效规避长周期精调的不确定性。
• 基于腾讯混元Turbo S模型在整体链路上负责内容生成、意图判断,通过提
示词优化,混元TurboS在对话效果上对齐DeepSeek。混元TurboS对H20资
源占用仅为DeepSeek的几十之一,在面对海量调用时,更能确保活动的平
稳运行。
16
《无畏契约》瓦手AI放号官-Agent实现方案及框架
采用腾讯智能体平台搭建三个Agent:
• 对话内容生成Agent:理解玩家本轮Promt,将历史对话与瓦手游戏知
识库相结合,回应和引导玩家输出自己对无畏契约端游或其他FPS、竞
技类游戏的理解和经验。为评价和资格概率概率Agnet提供打分素材。
• 试玩资格概率判断Agent:根据多轮对话内容,对玩家的资深程度进行
评级,评级(如S+、S等)则对应不同的抽中瓦手试玩资格的概率。
• 玩家评价生成Agent:根据6轮玩家的对话内容,给出对玩家的资深程
度的自然语言评语。评语需根据玩家评级区分正负面评语,做出合适风
格化处理
用户打开小程
序并登录 发起对话
玩家对话
次数>6?
试玩资格概率判断
Agent
玩家评价生成Agent
对话内容生成Agent
结束,根据试玩资格概
率抽奖
本轮对话结
束
抽中试玩资格的概率
对话内容生成Agent扮演着直接和玩家交流的角色,是本次活
动中最为关键的一环,它需要:
• 风格化,扮演扮演无畏契约手游靶场机器人的角色,以瓦的
风格和用户聊天;
• 熟知游戏相关术语,了解游戏内的角色、武器、玩法的细
节,以及玩家之间、论坛中流行的名词以及简称。
• 快速1-2轮内对玩家的fps游戏经验进行分流判断对用户进行
分类(无畏契约玩家、非无畏契约但FPS玩家、非FPS玩
家)
用户
对话内容生
成Agent
第二轮:通过前两轮对话,玩家会给出自身的
fps经验和理解,这时候通过Turbos对玩家进行
分类,并进行后续引导
第n轮:如涉及专业游戏知识,先检索游戏知识
库,再使用TurboS回复用户。
对话bot的设计:
第一轮:和玩家打招呼,并告知当前环节,以
及玩家和bot扮演的角色,引导玩家反馈游戏精
力。
17
AI陪玩:逗逗游戏伙伴,陪你游戏的AI伙伴
• App:逗逗游戏伙伴
• 开发者:北京心影随形科技有限公司
• 覆盖区域:中国
• 逗逗游戏伙伴定位为“懂游戏更懂你的AI伙伴”,主打游戏陪玩场 景,
延伸至学习、购物、社交等全场景陪伴,形成“破次元双向养 成”的
生态
• 上线一年服务超600万玩家,%用户反馈“AI伙伴让我重拾单
机游戏乐趣”
• 方案亮点
• 通过腾讯云TRTC的实时通信能力,逗逗实现了毫秒级延迟
(约1000ms)的语音对话,支持用户实时打断、追问和插
入新信息,交互体验接近真人对话
• 综合语音语气、屏幕内容与历史记忆进行多模态理解
• TTS作为备份,逐步切量
感谢聆听