共 169 篇相关文章

月之暗面发布Kimi K3开源权重模型,2.8万亿参数、100万token上下文窗口,在Deep SWE、SWE Marathon等基准测试中跻身第一梯队。本文基于长时间实测,详解其编码能力、3D开发、长时程Agent表现及安全隐忧。

深入解析神经网络隐藏层在XOR异或问题中的工作原理。通过数学计算、几何直觉和具体数值示例,讲清楚隐藏神经元如何通过特征空间变换将线性不可分问题变为线性可分,帮助你真正理解深度学习的核心机制。

系统梳理机器学习所需的三大核心数学知识——线性代数、微积分与概率统计,推荐《Mathematics for Machine Learning》、3Blue1Brown等经过社区验证的免费学习资源,并提供高效的理论与实践结合学习策略。

月之暗面、阿里、DeepSeek、美团四家同步冲进万亿参数门槛,中国开源大模型仅用18个月完成从B到T的数量级跃迁。本文深度解析万亿参数俱乐部的入场逻辑、智谱与MiniMax的追赶态势,以及参数军备竞赛背后的部署难题。

一位开发者使用Codex的Extra High推理模式处理一个20分钟任务,竟消耗70%配额。本文深度解析AI编程工具的token计费机制、高推理模式的成本放大效应,以及开发者如何合理控制用量。

吴恩达联合Anthropic推出Claude Code短期课程,涵盖底层架构原理、多实例并行编排、MCP服务器、Git Worktrees及三大实战案例,帮助开发者系统掌握AI辅助编程最佳实践,全面提升编程生产力。

大模型微调是什么?本文用通俗语言讲清微调的本质原理、适用场景与企业实战路径,帮助零基础开发者理解何时需要微调、微调改变了什么,掌握AI大模型应用开发的完整技能体系。

一位高中生借助Codex接入GPT模型,零代码基础打造出带悬浮窗、分级提醒和主题自定义的桌面ToDo应用,全程token花费仅15元。本文详解开发过程、真实成本与新手上手AI编程的完整体验。

从词向量、词嵌入到RNN、BERT、Transformer,再到ChatGPT与GPT-4——本文系统梳理大语言模型的完整进化脉络,带你读懂AI 2.0时代的技术根基与Prompt范式的确立过程。

月之暗面正式发布Kimi K3,拥有2.8万亿参数,成为全球规模最大的开放权重大模型。支持100万Token超长上下文、原生多模态与常开思考模式,并搭载Kimi Delta Attention等自研架构创新,多项基准测试跻身全球前三。
Open Deep Research:LangChain开源AI研究智能体完…
深度解析LangChain开源项目open_deep_research:基于LangGraph构建的AI深度研究智能体,支持多模型、多搜索工具灵活配置,已获12000+ Star。覆盖技术架构、核心工作流、典型应用场景与落地建议,帮助开发者快速掌握Agentic RAG实践路径。

Kimi K3正式发布,2.8万亿总参数、896个MoE专家、百万级上下文,编程基准超越GPT与Gemini。本文深度解析其线性注意力、Attention Vigilance等核心技术,以及Perception Bench多模态评测表现,带你读懂这款全球最强开源大模型。

微软科普节目《Cozy AI Kitchen》正式收官。本文回顾这档节目如何用「治愈系」风格、实景道具和人文视角,让普通人轻松理解AI——探索技术传播的另一种可能。

模型性能差距正在缩小,真正的竞争力在于可移植的AI智能体架构。本文详解如何构建Claude Code与Codex通用的智能体工作区,涵盖五大核心组件、三种可移植性分类及双向迁移实操,帮助团队永久摆脱厂商锁定。

Vibe Coding是一种全新的AI编程方式,无需编写代码,只需清晰表达意图,AI即可生成并运行软件。本文带你了解Vibe Coding是什么、为何正在爆发,以及普通人如何抓住这波AI时代红利。

GPU利用率仅51%却毫无察觉?本文通过TraceML工具的真实实验,揭示PyTorch训练中DataLoader隐性瓶颈,仅调整三个参数即提速43%。探讨如何将持续性能监控纳入MLOps流程,避免GPU算力浪费。

OpenAI发布GPT Live语音模型,支撑ChatGPT Voice实时对话体验。本文深度解析语音AI的核心挑战——延迟、打断处理与上下文理解,并探讨AI交互入口从打字向实时语音迁移的趋势。

Mesh LLM 是一款开源分布式推理框架,通过模型分层拆分,将多台普通设备聚合成「虚拟超级显卡」,让小显存机器也能运行数百GB的超大语言模型。本文详解其工作原理、跨平台安装体验,以及网络带宽这一不可回避的物理瓶颈。