日志
每个云侧组件(API 服务器、网关、许可证服务)都发出结构化日志。两项设置控制输出:
环境变量覆盖遵循标准
CYBERUN_<SECTION>_<KEY> 映射 —— CYBERUN_LOGGER_LEVEL、CYBERUN_LOGGER_FORMAT。
结构化字段
日志在适用之处使用以下一致的字段。聚合器可以基于其中任意字段建立索引:team_id—— 请求的团队范围(当属于团队范围时)。user_id—— 发起请求的用户,适用于用户发起的操作。task_id、agent_id、workflow_id—— 资源引用。credential_kind——integration、agent或device;从不记录凭证值。feature—— 当请求因功能门控被拒时,所要求的许可证功能。error—— 序列化的错误链。
日志来源
追踪(OpenTelemetry)
OTLP 导出已内置,默认关闭。按部署启用:
启用后,API 服务器、网关与代理都会为 HTTP 请求处理、任务派发、隧道生命周期与运行时调用发出 span。把端点指向任何兼容 OTLP 的采集器(Jaeger、Tempo、Honeycomb、Datadog、Lightstep 等)即可。
指标
一等的 Prometheus / OpenMetrics 端点,以及指标名、标签与推荐告警的文档,正在编写中。在它发布之前,运维方通常从下列来源派生运维信号:- HTTP 请求日志中的状态与延迟字段(聚合器侧,例如 Loki / OpenSearch)。
- OTLP 追踪数据(采集器侧)。
- 许可证校验器的续订事件。
任务事件流
任务进度被发布到内部事件总线(task.* 事件),API 服务器以两种形式转发给客户端:
- HTTP Server-Sent Events,位于
GET /api/v1/r/tasks/{taskId}/events—— 客户端订阅的官方线上格式。 - MCP
notifications/progress事件,通过stream_task_events工具(Cloud MCP)。
健康检查
每个云侧进程都暴露一个基础的存活探针端点。规范化路径、期望载荷与告警建议会在公开部署指南中一并发布。在此之前,把它们当作标准 HTTP200-或-非 来对待;正式的健康检查规范正在编写中。
