Please turn JavaScript on

SegmentFault 思否

Following SegmentFault 思否's news feed is very easy. Subscribe using the "follow" button on the top right and if you want to, choose the updates by topic or tag.

We will deliver them to your inbox, your phone, or you can use follow.it like your own online RSS reader. You can unsubscribe whenever you want with one click.

Keep up to date with SegmentFault 思否!

SegmentFault 思否: SegmentFault 思否

Is this your feed? Claim it!

Message History

现状

进入企业实习,团队普遍使用 AI Agent 工具开发:Trae、Cursor 等。

公司交付模式:任务多以整块CRUD、完整业务模块作为开发单元;考核只看最终输出,只要符合业务需求即可,不关心我内部实现过程。

对比个人过去的开发习惯:自己独立写项目,哪怕只是简单CRUD,也会花大量时间,逐行推敲代码合理性、正确性,深度思考实现细节,能实实在在沉淀技术理解。

感受工作上依赖AI工具完成任务,开发体验浮光掠影,只是拿到结果,缺少深度思考的过程;明显感觉自己技术学习收益变低,实际学到的东西越来越少;直观感受到AI降低行业门槛,行业壁垒在变小;甚至会产生怀疑:自己辛苦学习的很多技术知识,在实际工作场景好像用不上;一边要完成公司业务交付,一边又不想荒废自身技术成长,二者出现冲突。诉求

希望找到一套可行的平衡方案:


Read full story

如何判断 OpenAI 兼容接口是否静默忽略 temperature 等请求参数?

我在测试一些兼容 OpenAI SDK 的大模型 API。

目前遇到一个判断问题:部分接口收到不支持的参数时会直接报错,但也可能正常返回 200,无法确认参数是实际生效,还是被网关静默忽略。

例如下面的代码分别使用 temperature=0 和 temperature=1,对同一个提示词重复请求:

import os from collections import Counter from openai import OpenAI client = OpenAI( api_key=os.environ["TEST_API_KEY"], base_url=os.environ["TEST_BASE_URL"], ) ...

Read full story

目前所有中文 AI 模型(无论 GPT、Llama 还是国产大模型)处理汉字的底层方式,本质上都是把汉字当做一个「编号」(Unicode 码点),或者拆成 BPE 子词。模型看到的「一」(U+4E00)和「丁」(U+4E01),在数学上没有任何结构关系——它俩的编码仅差 1,但字形完全不同;而「一」和「贰」的编码相差巨大,但结构上却都含有「一」的部件。

汉字本身有明确的部件、笔画、结构关系。我想确认的核心问题是:在 AI 时代,中文的底层编码到底需不需要被重新发明? 也就是说,我们是否应该在 Unicode/BPE 之上,建立一层可计算的、包含汉字结构信息的中文编码层,而不是继续让模型把汉字当成无结构编号?

为此我设计了一套 32 位中文结构编码(CNBE-32),把每个汉字拆成 5 个字...


Read full story

各位大佬好,最近在尝试使用 AI 辅助重构一个比较老的项目,目前整体流程是使用Codex 进行。

目前我的工作流大概如下:

首先使用主 Agent(gpt-5.6-sol)分析整个项目,梳理架构,并拆分重构任务;
根据分析结果制定任务清单;
主Agent和子 Agent(gpt-5.6-Terra)并行执行任务;
大任务完成后,通过 open-code-review 进行 Diff 审查;
小任务完成后,让子 Agent 进行一次审查;
Review 阶段目前统一使用OpenCodeReview这个项目(gpt-5.6-Terra)

目前遇到的主要问题是:

整体开发速度非常慢,其中最大的瓶颈感觉是在代码审查阶段:

每次 open-code...


Read full story