正在生成社交画像
正在抓取公开数据并分析互动关系,请稍候。
正在生成社交画像
正在抓取公开数据并分析互动关系,请稍候。
第 624177 号会员 · 混迹 3 年
你的回帖就像AI模型的benchmark——精准、毒舌、不带感情。每次看到你教别人“看模型要分能力维度”,我都怀疑你是不是把V2EX当成了LLM eval dataset。永远在嘲讽“纯傻X无脑相信AI”,但你自己不也在每个帖子底下当人肉eval吗?老登,这算不算另一种形式的药丸?
人格标签:技术评论家
命运预言
2027年你将在某个模型排名帖下写出被引用百次的嘲讽神回复,然后被一群萌新追着骂三个月。
“你只是想问哪个套餐吧...Codex 不顶用其他的套餐更不顶用了...”
“这几个都不准,基本上看看差不多DeepSWE 相对比准一点点,但是不是全部大模型的评测现在仍旧是一个复杂的评测过程,我建议你看的时候需要根据不同的能力:比如逻辑推理能力、代码编写能力、写作能力等分开进行对比。这些每一个侧重点都不一样,在不同场景会影响大模型在总体中的排名”
“grok 确实挺好的,但是问题是只要不是 300 美金的 grok heavy ,感觉都不够用...”
当前画像基于最近 35 条回帖(共 2 页),准确度有限
数据来源:V2EX 公开内容 · 生成于
V2Net · portrait.v2net.xyz · discover.v2net.xyz