前言
今天是2026年7月25日,星期六,距离亿方听力大师正式发布还有不到48小时。
我坐在电脑前,刚从最后一轮测试里抬起头来——该修的bug修完了,该跑的流程跑通了,连那个困扰了我三天的角色管理器的渲染问题,也在Kimi K3的帮助下终于搞定。窗外是泰安夏天惯有的闷热,窗内是空调房里在电脑前敲着键盘的我。蝉鸣从中午一直叫到现在,但我心里却异常平静。
这篇关于亿方听力大师诞生始末的文章,我断断续续构思了很久——比写项目代码可能还要久。因为有些话,我想在发布之前说清楚。不是为了给项目写一份漂亮的宣传稿,也不是为了证明自己有多厉害。我只是想记录下这段从“我不知道自己行不行”到“我知道我行”的路——从一次跑操时的灵光乍现,到无数次差点放弃又重新爬起的时刻,再到最终看到曙光的瞬间。
谨以此文,献给这一路上所有帮助过我的人、AI大模型,和那个没有在半路停下来的自己。
但行好事,莫问前程。——引用自我喜欢三年多的一位UP主,也是因为教材助手项目认识快三年的那位姐姐
一
想必大家对“亿方教材助手”这个名字并不陌生。那个曾经帮助无数师生一键下载高清电子教材的开源工具,在走完它的取经路后,已于2025年正式宣告停更。有人问我,教材助手倒下了,亿方运维是不是也就此沉寂了?
我的回答是:不会。
2025年12月31日,跨年夜。我守在屏幕前,等待着在零点那一刻准时给那位在B站认识快三年的那位姐姐发送2026新年祝福。在等待卡点发祝福的间隙,我在当时常逛的一个电教运维论坛里,发布了一篇帖子——年底画大饼:亿方听力大师ListextEditor,直抒胸臆,一是说明我要干啥:年底画大饼,二是把我想好的软件名字发出来宣告一下,就像是在写Hello world。
帖子发出去,质疑随之而来。有人说这是画饼,有人说做不成。但我心里清楚,这不是饼,这是我多年的心病。
二
事情要从更早说起。
我是泰安的一名学生。从初中开始,英语考试的听力录音就一直让我听得头疼——不是因为我听不懂,而是因为播放听力的那个声音,实在太难听清说的是什么了。泰安的义务教育系统长期使用“一起作业”提供的听力生成工具,而这个工具调用的,是微软Windows系统自带的SAPI语音引擎。那是几个老旧的、机械的、生硬的、毫无感情的声音,每个单词像是被割裂开来的碎片,勉强拼凑在一起。
我至今记得中考时,有一个听力题因为那机械声音的模糊发音,我没听清楚。一个题而已,但那种无力感却刻在了心里。多少年来,这些零零碎碎的想法一直在我脑子里转,但奈何能力不足,一直没有付诸实践。
后来我发现,微软的EdgeTTS早已脱胎换骨。Azure的神经网络语音合成技术,让AI朗读几乎可以以假乱真。抖音上那些影视解说,天天用EdgeTTS默认的“云希”声音说着“注意看,这个男人叫小帅”——他们都能用上这么先进的TTS,为什么我们的考试听力,还要用那个老掉牙的SAPI?
2025年11月,高一第二次月考结束,听力一如既往地用那个机械声音朗读。与此同时,2025年正是AI编程的爆发期——Vibe Coding兴起,Agent可以写项目了。这次月考过后的某一次跑操,我边跑边想起来这件事情,由于我之前用AI编程有了一些做项目的自信心,于是认真想了想:“一起作业”那个听力工具的逻辑其实很简单,我用AI复刻一下,对接EdgeTTS库,应该不难。
光想不做,终究不行。我计划寒假动手。
三
2026年1月,寒假开始了。
正巧,我要为今年山东省科技周的编程比赛投稿,现学现卖做一个硬件编程项目。在学习过程中,我用了微软的MakeCode编辑器——它可以把代码和积木块来回转换。这个功能直接启发了我:与其让用户用代码去排版听力,不如用积木这种直观的形式,大大降低了学习成本,会搭积木就能做听力。
第二天早上,我看到阮一峰发了一篇文章,说GLM5的能力很强。恰巧,iflow工具也有免费使用额度——2025年12月得知我认识并喜欢的那位UP主在用以后,我也开始用了,用着还不错。于是我用Gemini给程序起了个大纲,敲定了基本语法。
我给这个项目起了两个名字:中文名直率地叫 “亿方听力大师” ,宣告这是亿方教材助手倒下之后,亿方运维的新起点;英文名叫 ListextEditor,是Listening和Text两个词的结合。不像一些学生写的教学软件动不动就起个洋名字充门面,我的英文名有内涵,中文名够直白。
程序的核心逻辑是类HTML标签语法,有块首和块尾的概念,类似于上世纪DOS系统中的WPS,初版语法甚至是我在手机上随手赶时间搓出来的,当时搓的语法很草率,也很简单,雏形大概这样:
<startsound src="Windy Hill">现在请听一段音乐并调试音量</end>
<role="man1">普通高中英语测验 第一学期 正式开始</end>
<!wait=5>
<role="man1">Hello!</end>
<role="woman1">Hello!</end>
我甚至在设计语法时就考虑了AI的角度——可以让大模型辅助参与听力材料制作,把听力原文自动转为Listext语法,做成能够真的放出来的听力材料,甚至是通过和AI对话直接生成完整听力材料。作为一个土生土长的学生党,我做过太多英语听力卷子,太清楚什么才是好用的工具。
四
然而开发并不顺利。
后来我才知道,先前那条帖子带来的连锁反应比我想象的要复杂。1月底,也就是寒假开始前没多久,论坛里突然有人发帖声称自己“填上了亿方的坑”——说是照着我的创意做出了一个听力生成工具,别人回复说,“他画的饼第一次这么快的被填上,还不是本人填的”,仿佛在质疑我真能把项目做出来。我点进去一看,他做的是个Python命令行项目,调用的是OpenAI的Whisper模型。且不说Whisper在国内根本用不了,单说这个工具的设计逻辑就完全跑偏了——它只是一个命令行程序,一般情况下教师不但不会用、没条件用,还只能做抽卡似的不稳定语音合成,压根不具备生成整套听力材料的能力,连最基本的片段循环都做不到。说白了,就是拿我的概念蹭了个热度,做的东西八竿子打不着。而那件事过后的2月,我其实就已经把雏形跑起来了。虽然bug多、界面糙,但至少能真正生成一份可以播放的听力材料——从文本解析到语音合成,整个链路是通的。别人在画饼的时候,我在敲代码;别人在蹭热度的时候,我的程序已经能跑了。回头看去,先前我画饼的那条帖子在当时竟然小火了一把。论坛里不少人参与了讨论,有支持的,也有看衰的。我当时没太在意热度,毕竟后续我也挥挥手离开了那个和我意见不合的论坛,只当是立了个flag,转身继续埋头构思项目框架去了。
我原计划春节前发布第一个版本,但bug太多,一直修不好。求助Linux.do也无人回应,还被质疑是不是“伸手党”,来找免费劳动力。大年初一的晚上,我把项目的基本思路和雏形仓库发到了Linux.do,终于得到了一些人陆陆续续的认可。
但项目因为那个Arduino硬件编程项目、我改程序的失败感和落差感(可能是触及到了当时模型能力的上限)和后来开学,搁置了。
而促使我下定决心无论如何都要把这个项目做出来的,还有另一个原因——犹记得1月底时那个电教论坛里部分用户的行为彻底激怒了我。论坛里那些所谓的教学软件,满屏都是影响正常使用的BUG,开发者却把责任推给用户,还要说是“开源软件按原样提供,没有义务修复”。这和我一贯的运维思想完全是反着来的。我把开源软件也要做出商业软件的水平,用户遇到问题我就要去解决,这才是该有的态度。那些质疑和冷漠,反而推动了我做这个项目的决心——我要用实际行动告诉他们我不是在画大饼,我真的可以做到,我要宣告我的运维思想。
五
转眼间到了2026年5月,学校举办科技节。信息老师说可以让我搞个软件演示,还说Token费用可以报销——那段时间OpenClaw(江湖人称“龙虾AI”)正火。我就抽了五一三天时间,用OpenClaw和Claude Code改代码。
结果效率奇低。中转站的Codex模型很垃圾——可能是因为日区降智了,也可能是模型本身注了水,我当时也不敢用国产模型,怕国产模型智力不够,影响效率。虽然它可能真的是什么“GPT-5.4”,但前端能力烂得离谱,只改好了一些基本功能,恰巧当时也有些别的事情安排,想去研究一些平时没时间研究的东西,大不了项目之后抽空再改,就没再做下去。也可能是当时用的Harness工具不对,毕竟OpenClaw本身也不适合编程。好在雏形已就,具备演示条件了。
当时我在网上做了调查。同类软件除了广泛使用的“一起作业”听力材料制作工具、一些有快十年历史的老软件,就是各路神仙发布在下载站的小型软件。
后来我顺着网线又去GitHub翻了翻,确实有一些开发者比我更早产生了类似的想法,也基于EdgeTTS做了些听力合成的小工具。但说实话,那些项目基本都属于“毛坯房”级别——能用,但距离“好用”还差着十万八千里:没有可视化编辑界面,没有积木模式,没有分轨角色管理,也没有完整听力试卷的编排能力。操作流程繁琐,使用门槛高,非技术用户根本无从下手。更离谱的是闲鱼,上面也有人在卖所谓的“听力制作工具”,有这么几个做的比较好的,但是编辑流程并不开放,不如我的项目自由度高,问作者说是“MVP功能一定要简化,我的太复杂”,还有的项目其实就是几个脚本打包在一起,功能残缺不全,界面是老套的,报错是随机的,售后也是不知道啥样的。就这样的水平,有些项目还敢按字数收费,合成一段听力材料要价不低。我当时心里就想:就这水平也敢拿出来卖钱?
另外我在搜索过程中还发现,就在3月份,有人也在多少和那个电教运维论坛有点关联的一家公司的官网上挂了一则“余大嘴式公告”,高调宣称做出来了类似项目。但我顺着链接摸过去,GitHub仓库早就没动静了,公告内容也再没有下文,项目的功能只是简单的对着当时那个帖子仿照,功能残缺不全是肯定的,甚至他们可能认为我那随手搓出来的第一版语法雏形太复杂了,又照着上世纪扫文盲时候搞的“二简字”的思路把我那简陋的代码格式再“简陋“了一遍。典型的雷声大雨点小。
这些对比反而让我更加坚定,这个项目做对了——积木模式搭建听力材料,业内首创。
虽然最后因为学校安排,演示没成,但我也不失望——至少白嫖了信息老师30块钱Token,也亲眼看到了人工智能这几个月飞速的发展。
六
2026年6月,AI圈风起云涌。
说起来挺有意思的——腾讯为了节省成本,开始限制员工用AI写代码了。结果呢?员工们发现一个尴尬的问题:**自己已经忘了怎么写代码了。**微软那边演的也是同一个剧本。他们把Claude Code开放给员工用,效率确实提升了,提升得还挺猛。但代价是——每个月的AI花费比员工工资都高。后来微软也扛不住了,转头去用DeepSeek了。
你看,不管是大厂是给还是停,所有人都已经离不开了。
从“无限畅饮”到“按量付费”,2026年的AI编程正在经历一场集体觉醒——而这场觉醒背后最核心的事实是:钥匙收回去不要紧,要紧的是,你已经开过车了。
Fable5横空出世,雷军挖走罗福莉后MiMo的昙花初现,MiMo2.5的出色表现,DeepSeek的降价——每个月都在变,这些足以促使我开始改程序。我本想等到暑假再集中改程序,但端午节这几天有了闲工夫,恰好MiMo Code有限免,一切操作不耗费任何Token费用。我就开始着手重构项目,甚至当时还怕放暑假以后MiMo的限免关闭。
暑假正式开始后,我越发觉得MiMo免费模型有点笨,想提高效率,于是找了好多公益中转站,用起来又嫌麻烦。又去试了DeepSeek的API接入OpenCode,一开始觉得还可以,随后发现效果有些烂。于是又找了个中转站充了十五块,简单用了下GPT-5.6 Luna,觉得还行但也没多实惠。用完余额又想省钱,就去折腾OpenCode的免费模型。
后来我在用OpenCode的免费DeepSeek V4 Flash时,无意间发现了Plan模式——先Plan再Build,效果竟然提升了不止一个档次。我用这种方式写了半天代码,期间还兴奋地跟我认识的那位姐姐分享,说是免费模型貌似还够用。她一听我一连串折腾的历程——一会儿找免费的中转,一会儿充十五块,一会儿换这个一会儿换那个——觉得怪麻烦的。
她说:“不要想那么多,主要是我看你换很多地方用免费的或者便宜的API挺麻烦的,正好账户上还有些余额,我平时也不怎么用。”然后直接把她的DeepSeek官网API Key给了我。她说这话时语气淡淡的,毕竟她早已不是程序员,也不再做长程开发的项目了。但我记得她以前写过很多代码,比如24年看了我亿方教材助手的某版代码以后,第一眼就发现了代码中的“代码味道”问题,又用了几行随手写的代码解决了我困扰一星期的问题,直接决定了亿方教材助手能够挺过教材大改,以及目标平台的多次改版。
我当时没敢用。认识她快三年了,她花在我身上的时间、精力和钱都不少,我总觉得欠了她太多人情,不好意思再用她的资源。我就想着先把自己充的余额用完再说。结果等我自己那点余额用完了,一查她的账户——竟然还剩一百多块,更不敢动了。但我问她,她却说:
“要是都纠结给别人带来什么的话,那所有人就没办法相处了。”
这句话我记了很久。后来我也就放心地用了她的API进行开发。
七
接下来是好几天的重构之旅。
每天我都以为第二天能改好,结果第二天又连滚带爬发现新的bug——在发布和不发布之间来回徘徊,来来回回好多次。就这么耗了将近一星期,眼瞅着日子一天天过去,发布时间一拖再拖,我自己心里也越来越没底。
转折发生在这个星期。我跟那位姐姐聊天时随口抱怨了一句,说DeepSeek的智商有时候还是不太够用,长程任务跑着跑着就飘了。她听完直接问我:"我用不用Kimi K3?Kimi官方送我的订阅,你要用的话我给你扫码登录。"
我当时第一反应是心动——毕竟Kimi K3现在是公认编程能力全球第一的模型,比Fable 5还厉害,能力摆在那里。但我又不太敢用,因为这东西比DeepSeek贵太多了,按量计费的话成本翻了好几倍不止。我不好意思再欠她人情。她说没关系,反正她早已不做长程开发的项目了——她已经不是程序员了,这些额度放着也是放着。
我犹豫了半天,最终还是接过了这个"人情炸弹"。
昨晚第一次用上K3,简单跑了两个小任务试试水,然后就关机睡觉了。但就是那两个任务的结果,让我盯着屏幕愣了好一会儿——重构了二十多处逻辑,运行下来零bug。那种感觉怎么说呢,就像是你闲着没事刷B站,突然间看到官方弹窗宣布——她一个普普通通的UP,却成了百大UP主。或者说,就像是你亲眼看到自己的电脑在面前爆炸,而你知道那爆炸的烟花里,每一道火光都是对的。
我把这事跟她说了。她回了一句:"你也看到原子弹爆炸了。"配了张图——山姆·奥特曼在用上GPT5之后发的那条推:"就像坐在椅子上看到核弹爆炸。"
我笑了好久。她懂那种震撼。也笑OpenAI:你那模型才哪到哪啊,今年的DeepSeek V4都比你那模型强吧。
今天早上起来,我继续用K3跑长程项目。效果比我预想的还要好——有bug也不需要来回拉扯好几轮,一轮之内就能修好。之前那种"今天肯定能发"的错觉,这次终于变成了"今天真的能发"的实感。我仿佛看到了曙光,那是真正的、不会再被新bug扑灭的曙光。
所以这一次,发布日期就是今明两天,不会再延期了。
而这一切,我最想感谢的还是她。她总说自己当不了百大,但在我这里,她比百大还百大。
值得一提的是,在询问龙芯版编译问题时,统信UOS的一位工作人员非常热心,帮我反馈了问题,还说等我上架给我免费推广。这份来自陌生人的善意,让我备受鼓舞。
如今,项目马上就要发布了。预计这星期可以正式发布并开源。
八
我始终相信,有人文主义的软件才能真正帮助到人。
亿方教材助手如此,亿方听力大师亦如此。教材助手当年坚持适配“五四制”和鲁教版这些“少数人”才会用的冷门教材,是因为我自己就是“少数”,深知被忽视的滋味。听力大师同样如此——我做过太多听力卷子,太清楚一个好用的听力制作工具长什么样。
所以这个项目从一开始就不是为了炫技。让每个人都能做听力,会搭积木就能做听力——这才是目标。因为我们的软件自始至终就是朝着制作完整工程的方向开发的,我们的软件完全有能力复刻很多英语听力的内容,从新课标一卷的高考题,到你家乡的中考试卷,甚至是你小学时候某次期末考试听的“听录音选图片”,这些听力材料我们的软件都可以完整复刻出来。
与此同时,我也想坦诚一件事。
这个项目比我写过的任何一个项目都要复杂。亿方教材助手说到底只是一个下载工具,逻辑链路是直的。但亿方听力大师不一样——它有语法解析引擎,有积木模式的拖拽渲染,有分屏实时编辑,有音频轨道的合成与混流,还要兼容跨平台打包。说实话,它已经有点接近我心目中“准WPS级”的准办公软件了。一个Word级别的软件,你说能做到0bug,那是不现实的。所以这次我可能做不到了——做不到发布即完美,做不到所有场景都覆盖,也做不到让每个用户第一次打开就丝般顺滑。
所以我想请你们帮个忙:发动众包的力量来测试。
如果遇到了bug,不要忍着,也不要默默关掉程序然后给它判死刑——告诉我,我一定修。我承诺,有bug我们绝对不会推卸责任,不会说“开源软件按原样提供,没有义务修复”那种话——那从来都不是我的风格。发现了问题,我们立刻提上日程,修好只是时间问题。这是我们一贯的惯例。之前亿方教材助手也有不能兼容某个系统版本的时候,也有小bug冒出来的时候,我们也是要致歉的,也是一个个修过来的。这次也一样,只是项目更大了,bug可能会更多一些,但态度不会变。
另外,我想多说一句。
这个项目的名字叫“听力大师”,起因是做英语听力的。但我心里清楚,它的可能性远不止于此。
如果你是非外语教学的教育工作者——语文老师、数学老师、甚至幼儿园老师——你也完全可以用它来做很多事情:语文听写、课文朗读配音、微课配音、数学听算的音频制作……只要你需要把文字变成声音,它就能帮上忙。
如果你不是教育工作者,那也欢迎你来探索它的无限可能。广告配音、小说推文配音、影视解说配音、视频配音——只要你能想到的场景,都可以试试。这个软件能做成什么样,不只看我写了多少行代码,也看你们能把它用到哪里。
我造了一把锤子,但我不知道它能敲出多少种声音。也许你们的想象力,才是这个项目真正的上限。
程序将尽可能保持长期开源,基础功能免费。但项目生存需要成本:每月45元的服务器费用,即将购置的199元网站主题,还有AI大模型的费用——如果继续用那位姐姐的余额,总有用完的一天,我也需要想办法可持续。
说起来, 这个项目做到现在,不算那些免费Token额度,光我自己掏的、加上信息老师报销的和那位姐姐帮我垫的,就已经花了小两百块钱了。如果再把那些免费额度按市价折算进去,三百块钱也是有的。一个学生做开源项目,花到这个份上,说多不多,说少也真不算少。所以下面要说收费的事,我得先把这个账摊开给你们看——不是卖惨,是觉得应该让你们知道,这个东西不是凭空变出来的。
因此,我们推出了订阅计划: 免费用户每月只能导出三次且含结尾音频广告水印,有角色数量等限制;付费用户只需极为低廉的30元年费即可享受无限导出、去水印、使用中英文以外的更多语音、建立无限个角色、售后服务、以及代码模式和积木模式各占一半分屏实时编辑等功能。一年三十块钱,看似收费,实为现实所迫。如果实在没有能力支付低廉的费用进行捐助,代码是开源的,可以自行修改代码去除限制,只不过不要大肆宣扬就是了。我相信这并没有背离我的开发思想,反而还会促进项目发展。如果哪天我忘了初心,也欢迎未来的我回来翻这篇文章。
第一批购买会员进行捐助的用户将成为奠基人,被项目永远铭记并展示,并有机会用99元的特别价格拿下可能绝版的软件永久授权。
九
说来有趣。许多学生写的同类软件喜欢用二次元相关元素做开发代号,但我更希望让中国传统文化浸润软件开发。
我计划将每个版本的开发代号按时间顺序与中国历史挂钩——从盘古开天辟地、鸿蒙初开,到建国、改开、小康,再到如今中国的腾飞,看看多久能让这个项目走完中华上下五千年的辉煌历史。每个代号都配以解释,说明为什么用这个词——朝代名、人物名或事件名,都是备选。
“时间就是金钱,效率就是生命。”
这句诞生于1981年深圳蛇口工业区的口号,1984年10月1日出现在庆祝中华人民共和国成立35周年盛大庆典的游行队伍中,从此在全国广泛传播。它折射出“发展是硬道理”和“效率优先”两个核心理念,直接催生了蛇口速度、深圳速度。后来,这个口号成为最有代表性、最能反映特区早期深圳精神的观念。可以说,这一观念的出现也是中国社会主义市场经济破壳的标志之一,是深圳精神的逻辑起点。
这句话放在这个项目上有两层意思:第一,用这个项目节省了自己的时间精力,甚至金钱,有更多时间去做其他事情,甚至可能因为效率提升而升职加薪;第二,给项目捐赠、解锁高级功能,可以提高制作听力材料的效率——花钱买时间,一举两得,非常划算。
亿方教材助手倒下时,有人说亿方运维完了。但我想说,这不是结束,这是新起点。从教材下载到听力制作,从Python到AI辅助编程,从一个人到一群人——这条路还很长,但我会一直走下去。
同时,说到浪浪山,可能有人会觉得这不过是我随手从电影里借来的一句漂亮话罢了,看起来像是我一年后还是放不下一年前那部电影。但其实不是。
去年亿方教材助手停更的时候,我嘴上说着"退场不散场",但心里比谁都清楚——那是我的第一个正经开源项目,倾注了那么多心血,最后还是没能走下去。那段日子我确实像是在浪浪山里打转:前方看不到路,回头又不甘心,不知道自己到底有没有能力再做出一款能真正帮到人的工具。说是低谷期也好,说是迷茫期也罢,反正那时候我连下一步该往哪走都不知道。
所以当我给这篇文章起标题的时候,"从逃离浪浪山到走向新征程"这几个字脱口而出——不是因为我多喜欢那部电影,而是因为它最能准确描述我这一整年的状态:从困在浪浪山里的迷茫,到翻过山看到了真正的曙光。
这也是为什么,结尾我还是要提那四个取经人。去年我说"亿方教材助手虽不知西天在何方,却始终向西而行",那时候多少带点自我安慰的意思。但现在再说这句话,心态完全不同了——因为我知道西天在哪了,也知道这条路走得通。
教材助手倒下之后我们爬起来了,这就是最大的意义。
最后,我想用一首歌的歌词来结束这篇长文。它唱给所有在各自道路上默默前行的人,也唱给那个在跑操时突发奇想、在深夜改代码、在无数次想放弃又爬起来的自己:
在茫茫的人海里,我是哪一个/在奔腾的浪花里,我是哪一朵/在征服宇宙的大军里,那默默奉献的就是我/在辉煌事业的长河里,那永远奔腾的就是我/不需要你认识我/不渴望你知道我/我把青春融进,融进祖国的江河/山知道我,江河知道我/祖国不会忘记,不会忘记我/在茫茫的人海里,我是哪一个/在奔腾的浪花里,我是哪一朵/在征服宇宙的大军里,那默默奉献的就是我/在辉煌事业的长河里,那永远奔腾的就是我/不需要你歌颂我/不渴望你报答我/我把光辉融进,融进祖国的星座/山知道我,江河知道我/祖国不会忘记,不会忘记我
亿方听力大师,即将启程。
项目开源地址:CNB 和 GitHub,欢迎持续观望,待到项目发布之时,定会在此处落笔生花。 欢迎赞助,成为奠基人 特别鸣谢:这一路上帮过我的所有AI模型——
GLM-5,GPT-5,GPT5.1,GPT5.4,GPT5.6,claude-haiku-4-5-20251001,MiMo-2.5,DeepSeek V4 Flash,DeepSeek V4 Pro,Kimi K3,GPT-Image-2,等。