KALYPSO

KALYPSO14B 开源编程模型, 数据全公开

KALYPSO-v1.1L 是 GenomaLabs-com 在 Hugging Face 发布的开源 14B 编程模型, 基于 Qwen2.5-Coder-14B, 在 18,049 条 agentic 与编码示例上微调, 并公开权重、完整数据集与去污染流程, 强调可审查、可复现。

free
开源编程模型KALYPSO代码生成Agentic编码Qwen2.5-Coder大语言模型数据去污染开源权重Hugging Face编程辅助
收录日期
4.1 (0 评价数量)

登录后可为项目评分

KALYPSO-v1.1L 是最近出现在 Hugging Face 上的一个开源编程模型, 参数规模 14B, 基座是 Qwen2.5-Coder-14B。相比很多只丢一个权重文件就完事的项目, 这次发布显得有点不一样: 模型权重、训练用的完整数据集、以及去污染流程全部公开, 用发布者的话说就是 "inspect everything"

这类做法在开源模型里不算常见。多数开源项目会给出架构和训练细节, 但很少把训练数据原样放出来, 更别说数据处理管线。KALYPSO 的发布者显然想走另一条路: 接受外界从头到尾的审查。

基于 Qwen2.5-Coder 的 14B 模型

根据项目描述, KALYPSO-v1.1L 在 Qwen2.5-Coder-14B 的基础上继续训练, 使用的数据集代号 Kraken, 包含 18,049 条 agentic 与编码示例。这些数据经过了人工整理 (curated), 并且针对 HumanEval 和 MBPP 做了去污染 (decontaminated) 处理。

这里有几个信息值得留意。18,049 条数据在动辄上百万条的预训练语料面前不算大, 更像是针对特定能力的精调数据集。所谓 agentic, 指的是让模型在复杂任务中调用工具、规划步骤、执行代码这类行为; 这类数据往往比普通代码片段更难得, 也因此更有价值。

去污染处理是针对一个老问题: 很多模型在训练时混入了评测集, 导致 benchmark 分数虚高。公开自己的去污染流程, 至少能让研究者判断这 18,049 条数据里有没有漏网之鱼。

为什么值得开发者关注

如果你做的是编程工具, 或者正在研究 agent 类应用, 那么 KALYPSO 提供了一个可以完整追溯的样本。你不仅知道它用了什么基座, 还能看到它吃了哪些数据, 以及数据是怎么被清洗的。这种透明度对复现实验、排查模型行为, 甚至做二次微调都会有帮助。

  • 可检查的完整数据集与处理管线
  • 基于成熟的 Qwen2.5-Coder 基座
  • 聚焦 agentic 与代码生成场景
  • 完全开源, 可自由下载使用

上手与局限

对开发者来说, 上手路径很直接: 到 Hugging Face 页面找到 KALYPSO-v1.1L, 下载权重, 用熟悉的推理框架加载即可。不过, 14B 参数模型在本地跑需要一定的 GPU 显存, 如果手头资源有限, 可能需要考虑量化和远程推理方案。

也要看到局限性。官方目前给出的信息比较浓缩, 没有详细的 benchmark 对比, 也没有发布技术报告。18K 条数据的规模决定了它更适合作为精调基座或者实验对象, 而不是覆盖所有代码场景的万能模型。

KALYPSO 的价值不在于卷分数, 而在于把整个训练过程摊开放在阳光下。

对于想深入理解编程模型数据工程的人来说, 这是一份不错的参考。

优缺点

优点

  • 权重、数据集与处理管线全部公开
  • 基于成熟的 Qwen2.5-Coder-14B 基座
  • 训练数据经过人工整理与去污染
  • 聚焦 agentic 编码,场景明确

缺点

  • 公开信息较少,缺少详细技术报告和基准测试
  • 训练数据仅 18K 条,规模有限
  • 14B 模型本地部署需要较高显存资源

常见问题

KALYPSO 是什么?

KALYPSO-v1.1L 是一个开源 14B 编程模型,基于 Qwen2.5-Coder-14B 构建,在 18,049 条 agentic 与编码示例上微调,模型和数据集都在 Hugging Face 上公开。

KALYPSO 免费吗?

模型权重与完整数据集开放下载,可免费使用。具体许可协议以 Hugging Face 页面说明为准。

KALYPSO 的训练数据是怎么处理的?

使用了代号 Kraken 的数据集,包含 18,049 条人工整理的 agentic 与编码示例,并针对 HumanEval 和 MBPP 做了去污染处理,流程也已公开。

KALYPSO 适合什么场景?

适合需要可审查训练数据的编程模型开发者,或研究 agentic coding 与代码生成的团队,也可作为二次微调的基座。

如何在本地使用 KALYPSO?

从 Hugging Face 页面下载模型权重,用兼容的推理框架加载即可。14B 参数对显存有一定要求,建议使用支持量化的环境以减少资源占用。

探索更多

相似工具

Locofy

Locofy

Locofy 是一款设计转代码的 AI 工具,定位在 Figma 与 Cursor、Claude 等编码代理之间。它借助设计感知模型与 LLM,将 Figma 和 Penpot 设计稿转换成前端代码,支持 React、Next.js、Flutter 等技术栈,并可通过 CLI 或 IDE 集成使用,为开发者提供可靠的 UI 基础。

Template Empire

Template Empire

Template Empire 提供生产级 Next.js 全栈模板和 UI 套件, 最大特色是每个版本都要经过 15 个 AI 模型(Claude、Codex、Gemini)交叉审核和 23/24 道质量门, 并附签署版报告。全栈模板自带认证、支付、后台等模块, 支持 Docker, 一次性买断无订阅。

Polygram Coding Agent

Polygram Coding Agent

Polygram Coding Agent 是面向 IDE 的 AI 编程助手,通过多代理工作流和模型路由,在 VS Code、Cursor 中完成从产品规划、界面设计到代码生成的全流程,官方定位为移动与 Web 应用构建器,适合快速原型的开发者和团队。

Stellar AI

Stellar AI

Stellar AI 是一款面向游戏开发者的 AI 脚本生成器,专精 FiveM 的 QBCore/ESX 框架与 Roblox 平台。它无需繁琐提示词,用日常英语描述需求即可生成带 fxmanifest 的完整 Lua 脚本,还能修复报错代码。免费版即可体验,付费订阅从 £10/月起。

AuraIntel

AuraIntel 是一款实时 AI 编码助手,以桌面覆盖层形式运行,号称在 Zoom/Teams/Discord 屏幕共享时不可见。它能捕捉问题、生成代码并自动输入到光标处,瞄准编程面试场景。但官方技术细节与定价未公开,且其隐身设计引发学术诚信争议。

Penling

Penling 是 agentic spec-driven workflow 工具, 让团队在共享工作区先共同定义规格, 再由 AI 生成代码并产出可评审的 PR。它把规格文档从个人 CLI 搬到团队协作空间, 支持 Google/Microsoft/GitHub 登录, 提供 14 天免费试用。

开源项目

DeepSeek-Reasonix:专为 DeepSeek 模型打造的终端 AI 编码代理

DeepSeek-Reasonix 是一个基于终端的 AI 编码代理,专为 DeepSeek 模型优化,通过 prefix-cache 友好提示降低 token 成本。配置集中在单个 reasonix.toml 文件中,支持切换任意 OpenAI 兼容端点。插件层集成 MCP 服务器和 Extension Protocol v1,提供工具和资源。Go 编写,静态单二进制,可交叉编译至六平台,也可通过 npm 和 Home 安装。许可证 MIT,官方宣称仓库有18803星(截至采集时)。

code-graph-rag:基于知识图谱和 LLM 的开源 RAG 系统

code-graph-rag 是一个开源 RAG 系统,利用知识图谱和大语言模型(LLM)来导航复杂的多语言 monorepos。它支持自然语言查询、深度代码理解和跨庞大代码库的编辑,帮助开发者更高效地管理复杂项目。项目主要使用 Python 编写,采用 MIT 许可证。截至采集时,该项目在 GitHub 上拥有 2333 个 star。

OpenMonoAgent.ai:本地大模型驱动的终端编程代理

OpenMonoAgent.ai 是一个开源且永久免费的终端原生编程代理,由本地大语言模型驱动。它提供无限 token 使用,并完全在本地运行以确保隐私。面向开发者,单命令安装,消除订阅费用和数据泄露风险。项目主要语言为 C#,采用其他许可证。

小程序雷达:微信小程序生态 AI 技术雷达

小程序雷达是一个开源、AI 驱动的微信小程序技术雷达,将框架、组件库、工具和 SDK 转化为可筛选、可对比的数据,提供雷达、对比、顾问、医生和每周视图。基于 Next.js、TypeScript、Tailwind CSS 和 Drizzle ORM 构建,收录236个资源,采用 GPL-3.0 许可证。

lanhu-mcp:开源 MCP 服务器,提升需求分析效率

lanhu-mcp 是一个开源的模型上下文协议(MCP)服务器,专为 AI 驱动的团队协作而设计。它能够自动解析需求文档,生成前端和后端代码,并提供设计资源的下载。该工具基于 Python 构建,官方宣称可提高需求分析效率高达 200%,并能顺畅地集成到现有的开发工作流中。对于加速原型制作和减少手动编码工作量尤为有用。项目采用 MIT 许可证,在采集时拥有 1614 个 GitHub 星标。

Tabby:自托管 AI 编程助手,GitHub Copilot 的本地替代品

Tabby 是一个开源的、自托管的 AI 编程助手,作为 GitHub Copilot 的本地部署替代品。它完全自包含,无需外部数据库,提供 OpenAPI 接口,可在消费级 GPU 上运行,并支持 RAG 代码补全和聊天功能。项目使用 Rust 语言开发,基于 Apache 2.0许可证开源。