关于AI热门话题和深层次理解
MCWXT:有兴趣在我这分享一些关于AI的知识吗?
Xray4668:有什么想知道的?
MCWXT:AI这一块:比如说你是平常怎么使用的,你平常使用AI有哪些技巧,有哪些大模型值得去使用等
文章内容来自:Xray4668,题目是编者加的
关于AI的一些问题:
- 你是平常怎么使用的
- 你平常使用AI有哪些技巧
- 有哪些大模型值得去使用等
大语言模型(LLM)是AI的一个方向,针对LLM而非泛指AI。更具体的描述并不适用于全部的场景,固化的语言框架会限制LLM的创造力,当执行创造力任务时只保留必要的描述能够带来惊喜。
高精度的问题则需要更仔细的描述。同样的问题在不同模型中能够得到不一样的回答,集思广益远好于多次随机。我认为国内的模型的软件工程相关能力与外国SOTA最大的差距在优质的经验,国内的模型很难注意到一些不算特别常见以及细节的内容。
关于LLM的框架:MoE与Dense,MoE指混合专家模型,Dense指稠密模型。大部分大尺寸模型属于MoE,MoE由路由模型和专家模型构成,路由模型决定使用那些专家模型(通常为固定数量),这导致了极高的不确定性,错误的专家模型选择会导致知识的缺乏引发严重的输出质量下降,但选择性激活大大降低运算开销,是主流选择。Dense会同时启动向前传播和向后传播,能够在低并发时拥有更高的设备利用率,同时结果因为执行了所有层的运算更可预见。
Anthropic的Claude我认为是模型能力最佳的SOTA,但其公司政策使其实际体验远远不如OpenAI的ChatGPT。对于国内模型,我认为对于指定问题的解决Deepseek是极为优秀的,但对于编码能力依然为GLM的强项,对于Agent任务依然推荐Qwen。
如何评价一个模型?这是一个多方面的问题。
首先,我认为响应速度是一个极其重要的方面
Step-3.7我实际体验下170TPS(token per second,170大概每秒460字),对效率的提升是极其巨大的,过慢的响应不只是减速,更严重的是思路的中断,有人认为通过对算力的堆砌就能解决,但模型的架构设计存在很大影响,激活的专家数,不同的重要注意力层,都会导致相同硬件下不同模型不同速度
其次,大家都在讨论模型的能力,但我认为 幻觉率 是极其重要的。
例如deepseek,有着严重的幻觉问题(v4 flash 98%,pro 96%可能有差异,需要审核),这导致结果偏离预期,会造成极大的预期落差,同时是的时间成本大大增加。而这是国内模型尚难以解决的问题,而Claude在这里的表现最为优秀(个人体验,实际测试数据不一定最优秀)。
有关系模型benchmark(跑分)作弊
有关作弊我认为deepseek在这里是最为优秀的,属于行业典范。Qwen这类问题比较严重,但它的小尺寸模型确实优秀,能够真正的“以小博大”,但分数需要理性看待
感谢Xray4668对我的大力支持,一起加油,无限进步!
