文章

GitHub一周热点第123期

长音频转写分离、并行Agent工作台、DESIGN.md资源集、AI交易Agent和健身动作数据集

GitHub一周热点第123期

「Github一周热点123期」长音频转写分离、并行Agent工作台、DESIGN.md资源集、AI交易Agent和健身动作数据集

GitHub一周热点第123期(2026/7/12 - 2026/7/18),本期内容包括 最强多说话人 ASR 模型、并行 AI Agent 工作台、DESIGN.md 资源合集、AI 交易 Agent 和健身动作数据集。

最后还有 2 份资料分享。 如果觉得内容不错,别忘了点赞关注支持一下。

1. MOSS-Transcribe-Diarize

  • 项目名称:MOSS-Transcribe-Diarize - 最强多说话人 ASR 模型
  • 链接:https://github.com/OpenMOSS/MOSS-Transcribe-Diarize

第一个项目是 OpenMOSS 开源的最强多说话人 ASR 模型,它要做的就是把语音转换成文字,但是这个过程其实不简单。 在语音识别领域,多说话人转录一直是一大难题,比如一场会议里需要处理好环境噪音,多人分离和重叠发言,还要保证说话人身份一直正确识别。 而本项目仅用0.9B的模型就做到了,还做的很好。 传统做法通常是 ASR 一套系统,说话人分离又一套系统,然后再把结果对齐。这样流程会变复杂,也容易出现错位。MOSS-Transcribe 的核心思路,是将语音转录、说话人归属和时间戳预测统一建模为一个自回归生成任务。输入原始音频,输出类似这样 [时间][S01]内容[时间] ,包括了说什么、谁在说、什么时候3结构化内容更适合程序的结果。

比如我们可以看到用它去理解了LOL的比赛视频, (放一小段demo) 可以很清楚的识别出解说的人,看过比赛直播的朋友应该有感受,到关键时刻那语速是和机关枪一样的。

在 7 月 14 日它刚刚拿了 INTERSPEECH 2026 第二届 MLC-SLM Challenge 的第一名,覆盖 14 种语言。对比数据也能看出来,MOSS 和 Doubao、ElevenLabs、Gemini、VibeVoice 等模型的对比,在字符错误率(CER)、多说话人综合字符错误率(cpCER)以及说话人归属稳定性(Δcp)三项核心指标上均取得最佳成绩。 在OPENASR Leaderboard 中,MOSS-Transcribe 取得全球开源模型第一的表现

而且0.9B的模型配备了 128k token 上下文窗口,能够直接处理最长约 90 分钟的连续音频输入。 项目有在线的demo环境,可以直接到上面去体验一下,能看到输出内容的形式。 如果想要自己测试,可以到 Hugging Face 下载模型,项目推荐用 SGLang Omni 或 vLLM 部署,本工具包还内置了一个本地字幕工作流,支持上传、审阅、字幕导出。

项目也同步放出了技术报告,整体来说是开放精神满满,感兴趣的朋友可以自己去深入阅读。

我觉得这个项目的实用价值很大,尤其是会议纪要、播客切片、长视频拆条等场景,而且它0.9B的大小非常友好,可以很容易在本地运行,所以项目很值得点个star持续关注。同时它也有一个pro版本,在模思开放平台,基于更大的模型,提供更强的能力,有需要的朋友可以直接使用API。

2. Orca

  • 项目名称:Orca - 并行 AI Agent 工作台
  • 链接:https://github.com/stablyai/orca

第二个项目 Orca,是一个面向 AI 编程 Agent 的桌面工作台。它的不是做一个新的模型,也不是要替代 Claude Code、Codex、OpenCode,而是把这些 CLI Agent 放到同一个工作台里统一管理。

如果你vibecoding比较多,你可能会有这样的一个诉求,针对同一个件事,你会想要同时开多个 Agent,让它们各自实现一个方案,然后对比谁做得更好。这个方法确实有效,但手动管理很麻烦。你要开多个终端、多个 worktree,记住每个 Agent 改了什么,还要自己切来切去看 diff。

Orca 解决的就是这个问题。它可以让 Codex、Claude Code、OpenCode、Cursor Agent、Copilot CLI 等各种命令行 Agent 并排运行,每个 Agent 在自己的 git worktree 里工作。你可以把同一个需求发给多个 Agent,让它们并行做,然后在一个界面里看结果,挑一个最好的合并。

项目里比较有意思的功能包括 Parallel Worktrees、Terminal Splits、GitHub 和 Linear 集成、AI diff 评论、远程 SSH worktree,还有一个手机端。也就是说你可以在电脑上启动任务,手机上收到 Agent 完成通知,再做后续的跟进处理。这个方向很符合现在“让 Agent 持续干活”的使用方式。

它还有一个 Design Mode,可以在真实 Chromium 窗口里点击某个 UI 元素,把 HTML、CSS 和局部截图直接发给 Agent。这个功能对前端调试挺实用,因为很多时候你光说“这个按钮不好看”是不够的,最好把真实 DOM、样式和截图一起给 Agent。

我觉得 Orca 代表的是 AI 工具的一个新阶段。大家正在从模型能力的强弱,想着如何更好的使用agent去过渡,而且现在各种agent工具越来越多,还有成本方面的考虑,所以如何能让各种agent一起调度就很有意思。现在很多实现的方式就是这种管理的任务台。

当然,这类工具也有使用门槛。并行 Agent 不是越多越好,跑五个 Agent 也意味着五份上下文、五份 token 消耗、五份需要 review 的代码。如果项目很小,一个 Agent 足够;但如果你经常让 AI 做实验功能、设计方案对比,那Orca 这种工作台就可以试试。

3. awesome-design-md

  • 项目名称:awesome-design-md - DESIGN.md 设计系统资源合集
  • 链接:https://github.com/VoltAgent/awesome-design-md

第三个项目 awesome-design-md,它是一个DESIGN.md的合集,前几期我刚好讲过的 DESIGN.md。 DESIGN.md是 Google 原始的规范,是给 AI Agent 看的设计系统文档。它告诉 Agent 产品应该长什么样。比如颜色、字体、按钮、卡片、布局密度、品牌气质,这些东西都可以写进一个 Markdown 文件,让 AI 生成 UI 的时候不至于每一轮都换风格。 当然纯概念的东西有人可能会感觉很抽象,但本项就更实际,它是一个 DESIGN.md 文件合集。

awesome-design-md 做的事情,是把很多真实网站的视觉风格提取成可复用的 DESIGN.md。比如 Claude、Mistral、Ollama、Cursor、Vercel、Linear、Notion、Stripe、Airbnb、Figma、Tesla、NVIDIA 这些品牌,它都整理了对应的设计风格说明。README 里显示目前已经有 70 多个 DESIGN.md。

这个项目的使用方式很简单:你从里面挑一个你喜欢的网站风格,把对应的 DESIGN.md 复制到自己的项目根目录,然后告诉 AI Agent “按这个设计风格帮我做页面”。这样你不需要 Figma 文件,也不需要复杂导出,对 LLM 来说 Markdown 是最容易读懂的内容。

我觉得这个项目火,也是这一两年 AI 前端正在经历的变化。过去大家主要讨论“AI 能不能写 React 代码”;现在问题变成“AI 写出来的东西能不能有稳定审美”。一个页面第一次生成好看不难,难的是后面加新模块、改表格、做移动端时,还能保持同一种设计语言。

当然也要注意,这类 DESIGN.md 只是参考风格,不代表你可以直接照搬品牌视觉做商业项目。真正做产品时,最好把它当成灵感和结构模板,再改成自己的品牌语言。但对原型、内部工具、个人项目来说,它确实能让 AI 生成的 UI 少一点随机感。

4. Vibe-Trading

  • 项目名称:Vibe-Trading - 个人 AI 交易 Agent
  • 链接:https://github.com/HKUDS/Vibe-Trading

第四个项目 Vibe-Trading,又是港大 HKUDS的开源项目, 它是一个开源的个人交易 Agent。就是把最近很火的 Vibe Coding 思路,放到交易和投研场景里。说实话最近港大在开源方面很热衷,我感觉已经看到好多个他们的项目了,而且都是比较接地气的使用agent。

这个项目的目标是用一条命令,把你的 Agent 变成一个带交易能力的助手。它不是只给你一个聊天界面问“今天买什么”,而是做了一整套金融 Agent 系统:有 FastAPI 后端、React 前端、MCP server、回测工具、数据源、因子库、策略开发、持久记忆、技能系统,还有各种 IM 通道。

它的功能范围很全面。比如内置了9 个类别中的 87 个专业 skills,有多种市场数据源,针对A股、美股等都实现了非常多的备选数据源;Alpha Zoo 里有几百个预置因子,可以做因子分析和回测;有 Robinhood等券商相关连接;还有研究假设、报告、session、scheduled research 等工作流。 整个项目看起来非常活跃,更新很频繁。最新的更新里加了 Longbridge market data,改进了中国市场数据的获取,还把 MCP server 支持到了 Streamable HTTP。

除了项目团队的勤奋,还有金融是 Agent 落地里最有吸引力、也最危险的方向之一。肯定大家都喜可以赚钱,但是真金白银的交易风险也是很高的。建议大家不要只看它能不能“自动赚钱”。更值得关注的是它在安全边界、回测验证、数据来源、权限隔离这些方面怎么设计,学习这些内容才是关键。

还是那句话,股市有风险,投资需谨慎。

5. exercises-dataset

  • 项目名称:exercises-dataset - 1324 个健身动作数据集
  • 链接:https://github.com/hasaneyldrm/exercises-dataset

最后一个项目 exercises-dataset,它是一个健身动作数据集。它收录了 1324 个健身动作,每个动作都有动画 GIF、180×180 缩略图、动作分类、目标肌群、所需器械,以及多语言的分步说明。 前端看到一个视频说。当你发现工作中你的职位和收入不能快速增长的时候,那你最应该干的事情就是锻炼身体。上班时候你要做的是,把尿喝白,把电充绿,顺便把孩子的作业打印好,这才是生活的真谛。 回到项目,本项目实用性绝对拉满,除了自己健身使用以外,很多人做健身 App、训练计划工具、AI 健身教练,最开始都会卡在基础数据上。动作名称、目标肌肉、器械、说明、图片、动图,这些东西一个个整理很麻烦,而且还要保证格式统一。

exercises-dataset 已经把这些都整理成 JSON 数据。它覆盖胸、背、肩、手臂、腿、腰腹、心肺等部位;器械包括自重、哑铃、杠铃、绳索、弹力带、壶铃、史密斯机等。README 里还统计了,单自重动作就有 300 多个,对居家训练类应用很友好。

它比较贴心的是支持 9 种语言说明,包括英文、西班牙语、意大利语、土耳其语、俄语、中文、印地语、波兰语、韩语。项目还带了一个 index.html,可以直接在浏览器里搜索、筛选和查看动作;还有 setup.html,可以帮开发者生成数据库建表、API 接入示例,甚至给 LLM 一个结构化 prompt,让它帮你生成后端接口。非常的贴心。

但是提醒下要看清楚授权。项目代码和数据是 MIT,但图片和 GIF 来自 Gym visual,有单独的媒体使用条款。

one more thing

最后还是分享 2 个资料。

第一份是中国工业互联网研究院的《Token驱动智能经济研究报告(2026年)》。到2026年 token 已经不止是一个模型计费单位,而是智能经济里的价值计量要素。互联网时代没流量什么都做不了,将来可能没token就寸步难行。报告里有一个说法很有意思:Token 正在构筑智能经济体系的“价值协议层”。

第二份是新战略咨询的《50+人形机器人场景应用落地图谱》。这份报告整理了 50 多个人形机器人应用案例,覆盖 12 类以上场景、100 多家集成商,里面包括工业制造、仓储物流、电力能源、化工、公共服务、商业服务这些方向。人形机器人真正落地通常是很具体的场景,比如上下料、搬运、巡检,看这份图谱就是让你看到机器人到底在什么环节先落地。

以上就是本周的全部内容,那我们下次再见。

1、项目名称:MOSS-Transcribe-Diarize - 长音频多说话人转写与分离模型 GitHub 链接:https://github.com/OpenMOSS/MOSS-Transcribe-Diarize

2、项目名称:Orca - 并行 AI Agent 工作台 GitHub 链接:https://github.com/stablyai/orca

3、项目名称:awesome-design-md - DESIGN.md 设计系统资源合集 GitHub 链接:https://github.com/VoltAgent/awesome-design-md

4、项目名称:Vibe-Trading - 个人 AI 交易 Agent GitHub 链接:https://github.com/HKUDS/Vibe-Trading

5、项目名称:exercises-dataset - 1324 个健身动作数据集 GitHub 链接:https://github.com/hasaneyldrm/exercises-dataset

1、项目名称:MOSS-Transcribe-Diarize - 长音频多说话人转写与分离模型 2、项目名称:Orca - 并行 AI Agent 工作台 3、项目名称:awesome-design-md - DESIGN.md 设计系统资源合集 4、项目名称:Vibe-Trading - 个人 AI 交易 Agent 5、项目名称:exercises-dataset - 1324 个健身动作数据集

ARR (All Rights Reserved)