注册并分享邀请链接,可获得视频播放与邀请奖励。

Feiteng 的个人资料封面
Feiteng 的头像

Feiteng (@FeitengLi)

@FeitengLi
Speech · Image · Video · LLM multimodal generative models Research → Infrastructure → Built AI algo serving 200M+ users 公众号: Generative AI Open to opportunities
1.3K 正在关注    3.5K 粉丝
搞机太耽误事了 1. 小尺寸模型训练没能跑 2. 把说话人识别能力加到 @EdgeSpeak_HQ 里也耽误了,DER 和 速度都碾压时代太多 不发出来可惜
增加显卡又又碰到一堆蛮烦,网卡还直接罢工无论如何启动不了,这次升级机器碰到的一系列的问题华硕老板在我面前都想枪毙他 100 次 1. 升级内存,B1 B2 两个就是检测不出来,换 CPU 来验证还是不行,最终换了个同款主板,又碰到启动卡在BOOT 阶段,按F2 DEL 无效、折腾几个小时是卡在键盘 USB 上,需要启动前把键盘拔了。 2. 这次把 PRO 6000 显卡插上去,启动也是遇到卡画面、折腾一会可以正常启动,再把网线插回去;他娘的 ping 不通,回到台式机前,login 进去找网卡也找不到、又是一番折腾尝试,网卡还是罢工 死活不亮了 只能买个 USB 转网口再试试
显示更多
增加显卡又又碰到一堆蛮烦,网卡还直接罢工无论如何启动不了,这次升级机器碰到的一系列的问题华硕老板在我面前都想枪毙他 100 次 1. 升级内存,B1 B2 两个就是检测不出来,换 CPU 来验证还是不行,最终换了个同款主板,又碰到启动卡在BOOT 阶段,按F2 DEL 无效、折腾几个小时是卡在键盘 USB 上,需要启动前把键盘拔了。 2. 这次把 PRO 6000 显卡插上去,启动也是遇到卡画面、折腾一会可以正常启动,再把网线插回去;他娘的 ping 不通,回到台式机前,login 进去找网卡也找不到、又是一番折腾尝试,网卡还是罢工 死活不亮了 只能买个 USB 转网口再试试
显示更多
OpenMOSS 开源 MOSS-Transcribe-Diarize-0.9B,多人长音频转写一次搞定「说了什么、谁说的、何时说的」。 0.9B 参数,128K 上下文,最长约 90 分钟音频一次喂进去,不切片不拼接。 4090 单卡,RTF 0.017,5–10 分钟录音 30 秒转完。 架构是 Whisper-Medium 编码器 + Qwen3-0.6B 风格 decoder,端到端一个自回归任务全包,不走 ASR+说话人分离+时间对齐那套级联。 带热词增强,人名/术语/型号能预配。 Apache 2.0,能商用。 模型 🤗 代码
显示更多
0
12
75
23
转发到社区
桥水基金在 Mira Murati(OpenAI 前 CTO)新公司 Thinking Machines 平台上发的 Technical Report。 拿 Qwen3-235B 做私有化微调,在金融文档筛选和央行报告解读上直接落地。 结果挺硬核:定制模型 Accuracy 直接拉到 84.7%(错误率比最强闭源 GPT-5、Claude 4.8 模型低 29.8%),Inference Cost 暴降 13.8倍。 背后是高敏感数据: Open-weight 是唯一解:敏感的金融核心数据,机构不可能天天往别人的云端送。国内 Qwen 系列长文本和微调上限足够高,成了华尔街追求 ROI 的完美底座。 Data Engine 是核心壁垒:他们砍掉了外包的脏数据,只拿 Hard Cases 让内部顶尖投资经理(领域专家)二次清洗。用高成本的“专家品味”洗出干净数据,才带高了模型天花板。 训练 Recipe 调优: 交错批处理 (Interleaved Batching):多任务训练按循环顺序交错,Accuracy 提了 12.1%。 CIPOS Loss + 非对称裁剪:换掉标准重要性采样,对策略偏离做非对称约束,又顶上去 10.1%。 优秀教师政策蒸馏 (OPD):每 20 步动态用验证集表现最好的 Checkpoint 当 Teacher,再刷了 3.1% 的点。 通用模型的边际效应在特定高壁垒业务上是在递减的。 最近看到的一个趋势:用“顶级开源底座 + 极致干净的专家数据 + 针对性的微调工程”去卷出高性价比的垂直智能。 @sgl_project @vllm_project 队伍都创办公司那融资是这个趋势标志性的事件
显示更多
Bridgewater used their unique financial knowledge and partnered with us on @tinkerapi to fine-tune a model that helps their analysts focus on what's important. Experts improving AI that empowers experts.
显示更多
0
4
130
28
转发到社区
由 Fable 5 领衔(仅半天)Codex 接力开发历时一周 #EdgeSpeak# 正式上线,转发的朋友联系我收邀请码
收藏破千,看来推友苦识别不准幻觉、时间轴不准久矣。 识别准 + 时间轴稳 + 说话人标记,全做好的寥寥。 要么我练手来写个桌面软件:内存 1G 左右,M4 上 40 倍实时率(1 分钟识别 40 分钟音频)。 桌面 App:拖拽文件转写、直接识别麦克风、会议纪要 兼容 OpenAI Audio API、可以接管 OpenClaw 音频理解请求、用于养虾 CLI & MCP Server(让 Claude / Codex 直接调) 一个程序,多种用法。差个名字了😑 一周时间出可用版本 觉得有用就转一下 —— 转发阅读前 20 第一批体验反馈。
显示更多
0
12
16
7
转发到社区
智谱 GLM-5.2 开源模型,干到全球前三、持平 Claude Opus 4.8,长程编码还超 GPT-5.5、成本只要 1/6。 但 5.0→5.1→5.2 这三代到底改了啥,挺容易搞混: 5.1 没动架构,纯后训练刷代码(48.3→68.7)。 5.2 是真大改:上下文 200K→1M,IndexShare 每 4 层共享一个 indexer,1M 下 per-token FLOPs 砍 2.9×;MTP 升级,接受长度 +20%。
显示更多
(Claude、GPT、GLM) GLM-5.2 Tops Artificial Analysis as the #1# Open-Source Model, Ranking Top 3 Globally GLM-5.2 launched and went open-source today, delivering a solid scorecard across multiple authoritative third-party benchmarks and arenas. 📊 Artificial Analysis Intelligence Index A comprehensive evaluation that integrates several authoritative leaderboards spanning coding, reasoning, long context, and more. GLM-5.2 scored 51, ranking among the top of all available models—on par with Claude Opus 4.8—and claiming the #1# spot among open-source models worldwide. 🎨 Code Arena A real-world head-to-head arena focused on front-end code generation, with Elo rankings produced by blind user voting. GLM-5.2 ranked #2# globally with a score of 1,595. 🏆 DesignArena A category arena centered on scenarios that combine design and code. GLM-5.2 took the top spot with a score of 1,360. ⚙️ FrontierSWE A software-engineering benchmark built around the "frontier of human capability," assessing engineering ability across three dimensions: implementation, performance, and research. GLM-5.2 ranked #3# overall. 💪 From front-end development and design-to-code to engineering-grade software tasks, GLM-5.2 consistently lands in the top tier across multiple real-world evaluation scenarios, steadily closing in on the world's strongest models. We'll keep pushing forward in pursuit of an ever-higher ceiling of intelligence.
显示更多
0
22
43
2
转发到社区
a16z 这期播客的标题是《AI,1997 年的互联网,以及接下来会发生什么》,请来的嘉宾是 Benedict Evans——前 a16z 合伙人、每年那份《AI Eats the World》是无数投资人和高管的年度必读,被认为是科技圈阅读量最高的分析师之一。 看标题就知道调子:这一小时,他几乎在逐条拆掉当下所有人对 AI 的确定感: 每月付 20 美元,却烧掉价值 1 万美元的 token;另一边有人折腾几天,收到 1 万美元的账单,整个人懵掉。 这不是 bug。这是 2009 年发生过一次的剧本。 他给当下定的调子是一句类比: 「我们在 1997 年,而我在努力预测 Uber 和 Airbnb。」 1997 年你看得见网页和搜索,但看不见叫车和短租——那要等十年,等智能手机和支付铺好才长出来。所以今天去赌哪个 AI 应用会赢,你赌的多半还是「网页本身」。 那他到底确定什么?他确定的是历史会押韵。 回到那个 20 美元的悖论——它正是 2009 年 AT&T 给 iPhone 配不限量套餐时发生的事。而真正该看的是结局: · 移动数据流量涨了约 1500 到 2000 倍 · 运营商股价二十年纹丝不动 · 「所有酷的东西都是别人做的」——因为价值全移到了上层 那这一轮的钱在往哪烧?今年微软、Meta、Google、Amazon 四大厂的资本开支指引合计约 7000 亿美元。Evans 顺手对标了一句:这逼近全球油气行业一整年的资本开支。 明知 ROI 算不清还要砸,因为这对几家大厂是「生死存亡」级的 FOMO——你不能让别人做而自己缺席,否则就是 2000 年代的微软、90 年代的 IBM。但他也划了条线:「我们不可能每年在 AI 基础设施上花 10 万亿,因为就是没有 10 万亿可花。」 那模型自己能不能赚到钱?他没下断言,只摊开一条论证链请人反驳:前沿模型没有网络效应、没有差异化、对技术栈没有杠杆。然后用一句利润对比钉死——Google、Meta、Amazon、微软、Apple 加起来产生的利润,超过整个电信行业。 他用一张 1950 年代的 IBM 广告收尾:一片工程师举着计算尺,配文「一台 IBM 电子计算器,相当于 150 名额外的工程师」。每一代技术都觉得自己前所未有。而他对这一切的判断只有一句: 「它会是魔法。二十年后我们只会说:当然就是这样。」 完整双语转录 + 章节摘要 + 字幕:
显示更多
最近推特上反复刷屏的 loop / loop engineering,出处就是 5 月 4 日这场访谈——Anthropic 的 Claude Code 创造者 Boris Cherny (出过一本 TypeScript 教材、靠写代码立身的工程师) 在红杉 AI Ascent 2026 上,第一次系统讲了他怎么用 loop。我把整场访谈视频翻译成了中文。 他抛出的第一个点:编程对他来说已经 100% 解决了。 「对我来说,100%。」 不是嘴上说说——他说模型现在写了他 100% 的代码,每天提几十个 PR,上周单日纪录是 150 个。Claude Code 的代码库也没什么秘密(被泄露了),就是 TypeScript 加 React。 那他一个人怎么撑起一天 150 个 PR? 靠 loop。这就是最近被反复讨论的那套打法——他让 Claude 用 cron 排重复任务,发出去就不管: 「而且到现在,我已经有几十个 loop 在跑各种任务了。」 有一个帮他盯 PR、修 CI、自动 rebase;还有一个每 30 分钟从 Twitter 抓反馈帮他聚类。他给的定性很重: 「我现在觉得 loop 就是未来。」 他还提到刚上线的 routines,原理一样,但跑在服务器上——「就算你关掉笔记本,它也还在继续跑」。 那这只是他一个人的极客玩法? 不是。他说整个 Anthropic 内部「已经没有任何手写代码了,所有 SQL 都是由模型写的」。工程师各自的 Claude 在循环里跑,还会通过 Slack 互相沟通,一起解决问题。 写代码这么便宜,软件公司会不会就没价值了——SaaS 末日? 他不这么看,但认为护城河会洗牌。借 Hamilton Helmer《七种力量》的框架:切换成本、流程壁垒这类会先失效,网络效应和规模经济仍然有效。他还押了个数字: 「我认为接下来 10 年里要颠覆一切的创业公司数量会增长 10 倍。」 那写软件这件事本身会变成什么? 他搬出印刷机:印刷机问世后 50 年,欧洲出版的文字量超过此前一千年总和,书价降了近 100 倍,识字率最终从约 10% 升到约 70%。他判断软件会沿同样的路平民化,「会比 50 年快得多」,最终「变成一项技能,就像会发短信一样」。 落点很锋利——最适合写会计软件的不是工程师,而是会计:「编码才是简单的部分,难的是懂领域知识。」 被问到两年后会怎样,这位创造者反而给了最诚实的答案:「哦,2 年后,哥们我真不知道。我们只做 1 周以内的计划。」 · loop 就是未来:几十个 cron agent 盯 PR、修 CI、抓反馈 · 编程 100% 解决、单日 150 PR · 公司零手写代码,Claude 之间 Slack 互相循环 · 切换成本/流程壁垒先崩,颠覆者 10 倍 · 印刷机类比:软件像识字一样平民化
显示更多
0
33
312
68
转发到社区
Boris Cherny(Claude Code 的创始人兼负责人) @bcherny 和 Cat Wu(Claude Code 产品负责人) 复盘 Claude Code 第一年: 一年前通用版上线,第一个 demo 发到 Slack 只换来两个 emoji;现在每天有几千个自主 agent 在跑。 这一年最反直觉的转变,是 Boris 已经不直接跟 agent 说话了。 「我跟一个 loop 说话,或者跟一个 routine 说话,由它来给 Claude 发提示词,这真的很疯狂。」 他把 18 个月概括成两次平台级跃迁:第一次,人从写源代码挪到跟 agent 对话;第二次正在发生,人从跟 agent 对话再挪到跟一个 loop 对话,由它去驱动 Claude。 loop 能干到什么程度?Cat Wu 留下的一个边界 bug,当晚被「另一个 Claude」先修好了——一位同事的 routine 专盯 5 小时没人回应的 bug 报告,自动提修复、容易验证的直接合并。Boris 说 routine 现在接管了全部代码审查: · 帮你盯着每一个 PR · 手动修 CI、手动 rebase 这些,他已经很久没做了 放手让 agent 自己跑,不会更危险吗?Boris 的判断正相反。 他的原话: 「其实你根本不想读大多数这些请求,把它路由给另一个模型去做安全检查,效果好太多了。」 理由是人性:当 99% 的权限提示都无害,人读着读着眼睛就发直了,真正危险那条反而被漏掉。推给用户前,团队拿数千条执行轨迹训练分类器,再让红队对代码库做提示注入攻击,每一次成功的攻击都变成一个 eval。 那怎么让一个 agent 能无人值守一直跑?Boris 的第一原则是不纠正单次输出: 「每次 Claude 犯了错,我不会告诉 Claude 下次要怎么做不同。」 而是把解法写进 CLAUDE.md 或做成一个 skill,把同类错误从此关掉。至于上下文,他给的是一条时间线——Sonnet 3.5 要做提示词工程,Opus 4 要做上下文工程,现在的模型两者都不要: 「给它最精简的系统提示词,最少的工具,然后让模型自己搞清楚。」 被问到下一步,Boris 没有预测形态,只说 agent 会跑得更久、更自主,同时并行的数量从一个跳到几千,而协调它们的界面会和现在完全不同——「再过一年,会是一套全新的东西,如果还是这些东西,那反而令人意外」。 完整双语转录 + 章节摘要 + 字幕:
显示更多
收藏破千,看来推友苦识别不准幻觉、时间轴不准久矣。 识别准 + 时间轴稳 + 说话人标记,全做好的寥寥。 要么我练手来写个桌面软件:内存 1G 左右,M4 上 40 倍实时率(1 分钟识别 40 分钟音频)。 桌面 App:拖拽文件转写、直接识别麦克风、会议纪要 兼容 OpenAI Audio API、可以接管 OpenClaw 音频理解请求、用于养虾 CLI & MCP Server(让 Claude / Codex 直接调) 一个程序,多种用法。差个名字了😑 一周时间出可用版本 觉得有用就转一下 —— 转发阅读前 20 第一批体验反馈。
显示更多
0
11
50
19
转发到社区
其实这些问题都能很好的解决了 1. 扔掉 whisper,换 ASR 模型,Qwen3-ASR 就很不错幻觉很少、也有一些别的ASR选择,whisper 幻觉多也要求 30s片段,Qwen3-ASR 塞更长的音频识别越准确,最大支持 20 分钟; 2. 文字时间轴 也扔掉 whisper 不是很准, 虽然 Qwen/Qwen3-ForcedAligner-0.6B 也能用,但实际测试超过 180s 就时间轴就混乱不堪,可以用 @LattifAI_HQ 4 小时都轻松准确, 可以到这里看看 卡拉 OK 字幕都十分准确,也有 skill speaker diarization 和 naming 也解决的很好了 3. VAD 切片我推荐自己的项目 准确性 Top
显示更多
要做好字幕 SRT,断句最重要,其次是纠正拼写错误。这些可以借助 AI 或者 Agent 来做了。 不过前提是先生成单词级别的时间戳,这样才能在组合后拼回去,现在主流语音识别模型都支持输出 json 格式,每个单词都标注清楚start和end的timestamp。 英文断句很简单,只要找标点符号就可以切分成长度合适的。 但中文断句要难一些,中文语音用whisper生成,吐出来的是一大坨没有标点的,并且它的“word”不是一个汉字,而是几个汉字。 所以需要借助大模型去断句加标点,然后再重新对齐时间戳再拆分,就需要用一些比较复杂的代码算法辅助。当然理论上来说 Agent 也能帮你做,就是费 Token 些。 还有一个坑就是几个小时的访谈,大模型是没办法一次性处理的,需要分块,但是分块还要注意不能切分在一句话中间。 最后不一定要用 Whisper API,现在电脑跑 Whisper 模型还是足够。 如果是 Mac,推荐用 WhisperKit,支持word level timestamp,以及识别 speaker
显示更多
0
37
833
136
转发到社区
哈哈哈 跟这个工作有些 “渊源”: 文章重点是连续VAE极致压缩,这个思路在25年初我实验验证过、因为客观因素没有继续下去( VibeVoice ASR 这个工作很是开心(虽然不是自己做的),VibeVoice realtime TTS 也跟自己在 24年初的一个 idea 一致; 说个八卦 VibeVoice 投 ACL 被拒了,因为我的一个没推过开源项目🤣,配合说明了下情况、也没给通过; VibeVoice 实测能力是不错的,没碰到幻觉的问题,尺寸 7B 跑起来还是需要一定资源的,长时间的输入对算力和内存要求还是有的; 把 speaker diarization 揉到 LLM-ASR 模型是个新趋势,其实继续延伸 就是 Gemini 音频理解呀(Gemini 还能直接推断 speaker name Gemini 输出时间轴幻觉仍然很严重的; 语音技术在 speaker diarization 和 timestamp 上近期都有新工作新思路,这些新方式都有严重幻觉问题,是在新方式上解决问题呢还是守旧地用传统方式,准备写个文章讨论下: 语音的十字路口😇。
显示更多