<?xml version="1.0" encoding="utf-8" standalone="yes"?>
<rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom">
  <channel>
    <title>统计学 on Xiang CHEN 陈向</title>
    <link>https://chenxofhit.xyz/tags/%E7%BB%9F%E8%AE%A1%E5%AD%A6/</link>
    <description>Recent content in 统计学 on Xiang CHEN 陈向</description>
    <generator>Hugo</generator>
    <language>en-us</language>
    <copyright>Xiang CHEN</copyright>
    <lastBuildDate>Sat, 01 Aug 2026 12:17:00 +0800</lastBuildDate>
    <atom:link href="https://chenxofhit.xyz/tags/%E7%BB%9F%E8%AE%A1%E5%AD%A6/index.xml" rel="self" type="application/rss+xml" />
    <item>
      <title>从“我的模型更好”到“如何科学证明模型更好”</title>
      <link>https://chenxofhit.xyz/posts/wilcoxon/</link>
      <pubDate>Sat, 01 Aug 2026 12:17:00 +0800</pubDate>
      <guid>https://chenxofhit.xyz/posts/wilcoxon/</guid>
      <description>&lt;p&gt;写算法论文时，实验几乎总是同一句话：新方法比已有方法更好。可很多文章却用 &lt;strong&gt;paired two-sided Wilcoxon signed-rank test&lt;/strong&gt;，而不是看起来更贴题的单侧检验。这并不矛盾——论文目标是“证明更好”，统计假设通常先问“差异是否可靠”。&lt;/p&gt;&#xA;&lt;p&gt;&lt;img src=&#34;https://chenxofhit.xyz/images/wilcoxon-statistical-methods-ai-comparison.png&#34; alt=&#34;Statistical Methods for AI Model Performance Comparison&#34;&gt;&lt;/p&gt;&#xA;&lt;p&gt;&lt;em&gt;图：模型比较中的单侧/双侧、配对/非配对、流程、选型与常见错误。&lt;/em&gt;&lt;/p&gt;&#xA;&lt;h2 id=&#34;1-比较的是差值不是两堆分数&#34;&gt;1. 比较的是差值，不是两堆分数&lt;/h2&gt;&#xA;&lt;table&gt;&#xA;  &lt;thead&gt;&#xA;      &lt;tr&gt;&#xA;          &lt;th&gt;Dataset&lt;/th&gt;&#xA;          &lt;th&gt;Ours&lt;/th&gt;&#xA;          &lt;th&gt;Baseline&lt;/th&gt;&#xA;          &lt;th&gt;$d_i$&lt;/th&gt;&#xA;      &lt;/tr&gt;&#xA;  &lt;/thead&gt;&#xA;  &lt;tbody&gt;&#xA;      &lt;tr&gt;&#xA;          &lt;td&gt;D1&lt;/td&gt;&#xA;          &lt;td&gt;0.72&lt;/td&gt;&#xA;          &lt;td&gt;0.65&lt;/td&gt;&#xA;          &lt;td&gt;+0.07&lt;/td&gt;&#xA;      &lt;/tr&gt;&#xA;      &lt;tr&gt;&#xA;          &lt;td&gt;D2&lt;/td&gt;&#xA;          &lt;td&gt;0.81&lt;/td&gt;&#xA;          &lt;td&gt;0.74&lt;/td&gt;&#xA;          &lt;td&gt;+0.07&lt;/td&gt;&#xA;      &lt;/tr&gt;&#xA;      &lt;tr&gt;&#xA;          &lt;td&gt;D3&lt;/td&gt;&#xA;          &lt;td&gt;0.68&lt;/td&gt;&#xA;          &lt;td&gt;0.70&lt;/td&gt;&#xA;          &lt;td&gt;−0.02&lt;/td&gt;&#xA;      &lt;/tr&gt;&#xA;      &lt;tr&gt;&#xA;          &lt;td&gt;D4&lt;/td&gt;&#xA;          &lt;td&gt;0.76&lt;/td&gt;&#xA;          &lt;td&gt;0.71&lt;/td&gt;&#xA;          &lt;td&gt;+0.05&lt;/td&gt;&#xA;      &lt;/tr&gt;&#xA;  &lt;/tbody&gt;&#xA;&lt;/table&gt;&#xA;$$&#xA;d_i = Ours_i - Baseline_i&#xA;$$&lt;p&gt;要回答的是：这些 $d_i$ 是否大到不像随机波动。&lt;/p&gt;&#xA;&lt;h2 id=&#34;2-为什么常用双侧而不是单侧&#34;&gt;2. 为什么常用双侧，而不是单侧&lt;/h2&gt;&#xA;&lt;p&gt;单侧直接对准“是否更好”：&lt;/p&gt;&#xA;$$&#xA;H_0: \mu_{ours} \leq \mu_{baseline},\quad&#xA;H_1: \mu_{ours} &gt; \mu_{baseline}&#xA;$$&lt;p&gt;双侧问的是“是否不同”：&lt;/p&gt;&#xA;$$&#xA;H_0: \mu_{ours} = \mu_{baseline},\quad&#xA;H_1: \mu_{ours} \neq \mu_{baseline}&#xA;$$&lt;p&gt;药物试验里方向往往事先钉死（例如只关心是否降压），单侧合理。算法 benchmark 不然：个别数据集上变差也是信息，审稿人通常希望你先报告“是否存在可靠差异”，方向再由均值/中位数给出。若 $p&lt;0.05$ 且中位差为正，仍可写 &lt;em&gt;significantly outperformed&lt;/em&gt;。&lt;/p&gt;</description>
    </item>
  </channel>
</rss>
