我现在已经很长时间没写任何东西力(撅望🤔但如果我能够想起来,而且我有空闲时间,我尽量写点什么,,,
ds4.1flash
就在这段时间里的某一天,小男梁发布了deepseek v4.1 flash,但这玩意最大的噱头其实是“超越4.0 pro”,为了这个噱头甚至愿意关停pro的推理服务并且以flash代之(包括将4.0 pro的请求直接路由到4.1 flash),而不是它又发明了什么新架构🤔具体来说超不超越4.0 pro那鬼才知道,但我实际用下来的效果是基元律动的号消耗得确实慢了很多,以我转deepseek和dsh之后的极高强度开发方式,以前用4.0 pro一个68的号只能用一天甚至半天,切4.1 flash后居然能坚持半周以上🤔而干活方面居然没有任何降低,反正我之前不是也说过,我干的活也许4.0 flash也能随便干,切到4.0 pro或者4.1 flash那算是升级(确信🤔
这中间发生了一个一个一个一个极其尴尬的小 插 曲,当小南梁宣布它极其逆天的以flash代pro计划时,我居然看错了日期,提前接入了官方api的4.0 pro🤔那它当然不会以flash计价,而是pro,,,最后喜提一个请求算上巨量的未缓存输入花掉字面意义上的十块甚至⑨块,毕竟这是官方api(撅望🤔
现在我测试的一大堆第三方provider,只有基元律动接入了4.1 flash,senseaudio现在还停留在4.0 flash,而且它还下线了4.0 pro🤔至于sensenova,它尽管保留了4.0 pro,但它那个rpm限制基本上没法正常用,,,🤔而在没那么喜闻乐见的本地(?)部署方面,如果4.0 flash可以靠混合推理的申必里技在5090上勉强跑起来,4.1 flash想都别想,首先它的参数量直接上到了500B,这和700B左右的glm 5.2已经区别不大力,,,🤔它还采取了申必新架构,尽管有那么200B的东西可以放内存里,但那也意味着剩下300GB最好全放显存里,那我们只能拜了个拜,,,🤔
cyrenebot evelved
出于某种申必原因(其实也没那么申必,无非是我搞到了一个zzz的角色音频数据集),我这两周甚至一周开始对昔琏bot和端脑云定制节点体系进行多轮重大升级🤔这些升级增强了昔琏bot调度容器的能力,使得最多五个线程的批量rvc训练成为可能🤔而推理方面,由于我训练的角色模型突破了70人大关,现在用一个线程推理实在是慢到吴法接受,我设计了一套多线程推理体系,还加上了一个简单的标签系统,通过预填的标签筛选角色,,,但我觉得最有意义的升级是添加了从本地直接上传原歌曲文件的选项,此时填的是它在本机上的绝对路径,这种用法在discord bot上确实很奇怪,但考虑到这个功能只有我一个人用,,,就这样🤔它有两种上传模式,如果是单线程可以直接将歌曲二进制上传到目标节点,但如果是多线程的话,它会先上传到lanzou,然后我在远端实例加强了lanzou链接的解析能力,它现在可以接受lanzou链接作为输入力,,,🤔
而当lanzou链接可以用来输入,那么它就可以用来处理十分钟甚至⑨分钟的歌曲(比如move的某张专辑里的某些超长trance歌曲),那么它的产物(24bit flac)肯定会超过100MB,这样上传lanzou就必然需要分卷打包、降bitdepth到16bit,换句话说一个角色需要上传一个一个一个文件啊啊啊啊啊🤔这需要同时改三部分东西,远端节点需要支持分卷打包、降bitdepth和上传,并返回新格式响应,bot需要能够解析这些响应并且post新格式json,我的批量下载脚本和解析html也需要能够解析新json🤔
至此,以前我将昔琏bot和端脑云节点分开会话开发(然后用一个api文档交换信息)的搞法完全搞不动,我现在已经授权dsh一次性将其纳入同一个会话开发🤔之前那些旧会话只在额外添加一些支线功能(比如给html加个在线播放的功能)时使用(确信🤔在长达三天啊三天的吉列豆蒸开发后,我终于搞定了所有这些玩意,然后我便可以疯狂制作一些牢登音乐的现代萌妹翻唱力,比如gta vice city的某些电台歌曲(其实move歌曲也算牢登音乐🤔
independent node
除此之外,我还设法创建了一个不受昔琏bot管理的端脑云实例,给它装上了简单的服务模块(比如开机之后自动打开comfyui和监控网页的脚本)并且归另外一个dsh会话管理🤔然后在它上面跑了一系列的测试项目,比如:
AICoverGen
这是一个和我的全自动翻唱差不多类型的项目,只不过没我的玩意自动化程度高,我做的是一个bot操纵的api,但这玩意用的是gradio实现的webui🤔我的rvc模型当然也可以加载到它上面,随便找了一个歌曲测试了下,它的分离流程大概是先分离和声再去混响,约等于我的v2流程(确信🤔但最终产物和我的同歌产物相比,不仅分离的质量不行,我怀疑整首歌质量也不行🤔可能是因为我开启了tta,而它可能还停留在某个旧的分离模型而且没有开tta🤔它唯一能称得上优点的,可能只有显存占用小力,,,🤔
qwen3.8 27b
现在最火的而且也是智能程度最高的小模型,官方模型就已经表现得非常不错,更何况它有无限的后训练提升空间,,,但我既然花5090部署它力,那肯定要部署它的uncensored版本,不然为什么我不去provider用它,而我都花钱用provider力,为什么我不用deepseek v4.1 flash(27b并没有因为它参数量小就收费少很多🤔部署下来效果还行,4bit量化大概占17GB显存,开启上下文到128k占到了22GB,开到256k占用28GB🤔考虑到我还开了mtp,最后我撅腚只开128k🤔mtp对推理的提速取决于这个实例的gpu有没有和别人共享,不共享的情况下它能干到接近100tps,如果有人在用的话就只能达到30甚至20力(悲🤔100tps的体验基本上持平deepseek v4.0 flash🤔
接下来我的其他几个容器都部署了dsh,端脑云实例也是个容器,所以它也可以部署个dsh🤔但它有一系列的坑,比如http路径什么的需要额外折腾,不然就会发生一个请求卡好几秒的逆天bug,一看网络请求,大概十成甚至⑨成的网络请求完全发错了地址,就这样它还有10%甚至⑨%的可能性居然能发出去也是神🤔whatever,它这个dsh被我调教好后,我就可以原汤话原食,让它的dsh使用它自己部署的27b模型做事🤔比如,分析它这个容器的资源🤔
在一顿野兽分析后,它得出了结论,尽管系统内存高达512GB,但它这个容器能够使用的内存资源居然只有96GB,,,那它官网写的128GB内存是何意味啊🤔whatever,现在回头再看deepseek v4.0 flash的混合部署方案,显存+内存至少得有170GB,好,我现在知道端脑云是完全没法部署uncensored版本的deepseek v4.0 flash力(撅望🤔
yolobitte
我还顺便在上面部署了一个之前做的yolo训练推理框架,随便找了个人脸数据集进行训练,实测5090的训练速度大概是我本机矿卡的16倍,反正快的1b🤔不过推理时,同一张图远程实例和本机的推理时间居然几乎完全一致,都是60ms,可还行🤔这个速度基本上意味着5k@30fps的视频也能实时标定人脸框(确信🤔话说yolo这种东西推理时需要gpu吗,,,🤔
next grossprojekt
接下来我希望能够用ai做点后端开发之外的玩意,比如,,,gpt6不是号称它能够随便玩blender或者任意游戏引擎吗,不是可以随便突破closedai的内网然后黑hf偷答案吗,那么我让它将尾行3逆向拆解一番并且在任意现代游戏引擎里重新实现一遍,应该不过分⑧,,,🤔但接下来就有一个一个一个一个问题,gpt这个b模型,它连开发个jiaotu全自动注册脚本都不愿意,让它去逆向,更别提逆向尾行3,,,那它的安全护栏第一个一个一个一个不答应啊啊啊啊啊(全恼🤔而如果我用deepseek或者glm干的话,又感觉不怎么行?🤔
我现在还在构思阶段,大概需要一系列的xx工程,,,比如,我不能上来就将尾行3的目录扔给它然后让它立即用three.js写个浏览器版尾行3,我得先,,,找个逆向专用skill,然后用deepseek v4 pro来先逆向尾行3,分解出它的资源(这一步也没那么难,经常做illusion游戏mod的盆友都知道,我们有114514款解包工具),分析出它的各种逻辑?然后才能用另外一个模型来写游戏🤔用three.js来写3d游戏已经算是烂大街的llm测试项目力,至少在裸模型时代就已经便乘了一项传统,当然也是llm输学的重要组成部分(至少某些进化未完全的玩意儿叫嚣“评分没输过、实测没赢过”时,它们所谓的实测部分十成甚至⑨成包括拿three.js写游戏,但这和我这种拿ai写discord bot等后端的又有什么鸡巴关系捏,,,),但拿three.js写hentai游戏?我寻思它能不能过安全护栏这一关(悲🤔
所以,这就是为什么我还是需要部署一个uncensored版本的deepseek v4.0 flash的,至少它可以做hentai游戏这一部分?🤔而deepseek v4.0 pro搞逆向其实已经非常成熟力,尽管我还没试过,但已经有很多成熟的skills可以做到这点,它们连gpt都可以雷普(当然,以gpt pro账号光速被橄榄为代价),雷普个deepseek或者glm又有啥难度?🤔我甚至还看到一个手机版的全自动破解器,它看上去像luckypatcher,但比前者牛批114514倍,前者只会套模板,它可是个破解专精agent,直接使用模型(比如我看到它可以使用deepseek v4.0 pro)干🤔很不幸的是我没有root了的手机,估计没法用它(撅望🤔