feat: 完善模型用量趋势与全局手账卡片并补齐阶段验收
This commit is contained in:
@@ -1,5 +1,21 @@
|
||||
# 第二阶段团队分工表
|
||||
|
||||
## 2026-09-05 当前完成情况补充(不含杨侧验收)
|
||||
|
||||
以下状态补充早期任务清单,历史未勾选项不再单独作为实时完成率依据。杨星萱负责的 Benchmark、检索调优、导出及函数图像不在本次验收范围。
|
||||
|
||||
- A/B/C/C.1/D 基础工程已落地;E 的离线协议验证已通过,真实目标厂商专项待完成。
|
||||
- Theme:补齐 SemVer 最低版本拒绝、文件/URL/ZIP 共用校验及安装前隔离视觉预览。
|
||||
- Mermaid:真实编辑器及 Markdown 预览接入缩放、重置、大图查看;编辑器预览复制导致的异步标记丢失已修复。
|
||||
- Agent Trace:支持关键词、事件类型、工具及仅错误筛选,保留树的祖先节点和引用定位。
|
||||
- F:本地 Qwen3-ASR、ERes2NetV2、Bekko 已完成 37 分 16 秒录音的 CUDA 转写、片段聚类、笔记及向量检索闭环,约 661 秒生成 441 片段;无参考标注,质量专项保持未完成。
|
||||
- Provider:卡片显示启用状态,支持直接启停与保存失败反馈。
|
||||
- Plugin context_menu/toolbar 按已有本地计划仍是后续增强,当前实际挂载 command_palette 与详情命令;不将声明 Contract 视为已挂载。
|
||||
- 逐字强制对齐、多人重叠语音未实现;说话人阈值、准确率、真实厂商专项未验收。Tauri/Rust、生产沙箱仍属于后续阶段。
|
||||
|
||||
本轮自动化基线为后端 577 项、前端 280 项及前端生产构建通过。长录音无标注,测试通过不等于质量或所有第二阶段专项全部完成。详细证据见 `docs/development/阶段F收尾验收记录.md`;本地运行文件不提交。
|
||||
|
||||
|
||||
## 一、阶段目标
|
||||
|
||||
第二阶段延续第一阶段已经形成的模块边界,重点推进多模态输入、MCP 与 Plugin 扩展、更多 Provider、RAG / Agent Benchmark、多格式导出、主题社区格式、Agent Trace 可视化、Mermaid 渲染和函数图像绘制。
|
||||
|
||||
@@ -144,3 +144,11 @@ cd backend
|
||||
.venv/Scripts/python scripts/local-model-smoke.py qwen3-asr --download --audio C:/path/to/speech.wav
|
||||
.venv/Scripts/python scripts/local-model-smoke.py eres2netv2 --download --audio C:/path/to/speech.wav --reference C:/path/to/reference.wav
|
||||
```
|
||||
|
||||
|
||||
## 2026-09-05 长录音与 Provider 状态补充
|
||||
|
||||
- 附件上传上限为 128 MiB。超过 25 MiB 的音频必须明确选择 `local_only=true`;可联网任务仍限制为 25 MiB,前后端及路由均检查。解码时长仍限制为一小时。
|
||||
- 本地解码允许跳过少量损坏音频包,按包中可取得的时长补静音,并返回 `MEDIA_CORRUPT_PACKETS_SKIPPED:<数量>`。超过 100 个损坏包则失败;缺少有效包时长时无法承诺时间对齐,应结合原音频复核。此处理不能恢复丢失语音。
|
||||
- Provider 卡片显示“已启用/已停用”,支持直接启停。保存成功后更新状态;失败保留原状态。停用或保存期间禁用测试与刷新模型操作。
|
||||
- 37 分 16 秒的用户录音已完成 CUDA 转写、片段级说话人聚类、笔记生成、本地向量索引及检索命中。无参考标注,不报告准确率。详见《阶段F收尾验收记录》的长录音补充;此前短样本记录保留为历史证据。
|
||||
|
||||
@@ -47,9 +47,29 @@ CPU 与 CUDA 分别创建隔离 Vault、附件目录和 SQLite,只读取固定
|
||||
|
||||
## 未关闭的专项验收
|
||||
|
||||
- 带参考转写和说话人标注的真实课程长录音尚未提供,不能报告 CER/WER、DER、阈值或长音频吞吐达标。
|
||||
- 已提供无标注长录音,CUDA 功能与单次耗时验证见下文。参考转写和说话人标注仍缺失,不能报告 CER/WER、DER、阈值或业务吞吐达标。
|
||||
- 现阶段时间戳为片段级;逐字强制对齐、同段多人/重叠语音仍未实现,不将片段聚类视为完整说话人分离。
|
||||
- 外部供应商特殊 JSON 的兼容性,需要在目标账号和模型上点击实际推理验证;离线协议通过不替代厂商验收。
|
||||
- Tauri/Rust Host 和生产 MCP 沙箱按后续阶段安排;本轮数据持久化在后端 SQLite/Vault,为桌面集成保留稳定接口。
|
||||
|
||||
结论:阶段 F 本轮工程收尾已实现并完成 CPU/CUDA 功能验收;上述质量及外部服务专项保持待验收状态,不标记为全部通过。分支仍需独立审阅后决定合并。
|
||||
|
||||
|
||||
## 2026-09-05 长录音补充验收
|
||||
|
||||
用户授权使用本机 CUDA,只做本地处理。使用隔离的 SQLite、附件目录与 Vault,读取已安装的固定 revision 权重;原音频、转写正文和独立运行报告保留在被忽略的 `.local-plans`,不入库。
|
||||
|
||||
| 观察项 | 本次结果 |
|
||||
| --- | --- |
|
||||
| 输入 | MP3,89,424,101 字节,2235.60 秒(约 37 分 16 秒) |
|
||||
| 转写与片段聚类 | completed;441 个片段,5 个说话人聚类 |
|
||||
| 两环节总耗时 | 约 661 秒(轮询含最多约 10 秒误差),RTF 约 0.296 |
|
||||
| Qwen3-ASR 实际设备 / 加载 / 推理 | cuda:0 / 10.52 秒 / 607.78 秒 |
|
||||
| ERes2NetV2 实际设备 / 加载 / 推理 | cuda:0 / 3.97 秒 / 28.88 秒 |
|
||||
| 后续链路 | Markdown 笔记生成、本地 Bekko 索引、向量检索命中均通过 |
|
||||
| 隐私标记 | 导出笔记保留 `embedding_local_only: true` |
|
||||
| 警告 | 1 个损坏音频包按时长补静音;说话人结果为片段级 |
|
||||
|
||||
最初实测暴露了 25 MiB 限制和单个损坏 MP3 包导致整任务失败,已修复并用同一输入重新跑通。5 个聚类不是已确认的真实人数;没有参考转写或说话人标注,因此不计算 CER/WER、DER 或 FAR/FRR。单次耗时也不作为跨设备吞吐承诺。逐字对齐、重叠语音和目标厂商真实验收仍未关闭。
|
||||
|
||||
本轮自动化基线:后端 577 项、前端 280 项通过,前端类型与生产构建通过;构建仍有既有大 chunk 提示。离线 Provider 测试不代替目标账号实测。
|
||||
|
||||
Reference in New Issue
Block a user